v2-360 vs Video-MME 出题质量差距分析报告
基线准确率 73.2% | v2 覆盖 6/12 类型 | VME 共 900 题
1. 全局概览
| # |
题型 |
VME 题数 |
v2 题数 |
VME 准确率 |
VME 主导模式 |
v2 主导模式 |
差距等级 |
| 1 |
Information Synopsis |
163 |
0 |
-- |
全局主题识别 (61%) |
-- |
CRITICAL |
| 2 |
Counting Problem |
48 |
0 |
50% |
全视频离散段计数 (29%) |
-- |
CRITICAL |
| 3 |
Attribute Perception |
27 |
0 |
-- |
否定/假命题验证 (26%) |
-- |
CRITICAL |
| 4 |
OCR Problems |
14 |
0 |
-- |
计分板/数值精确读取 (29%) |
-- |
CRITICAL |
| 5 |
Temporal Perception |
6 |
0 |
33% |
事件时间定位 (50%) |
-- |
CRITICAL |
| 6 |
Spatial Perception |
3 |
0 |
33% |
时空定位/朝向推理 (各33%) |
-- |
CRITICAL |
| 7 |
Action Recognition |
63 |
30 |
-- |
时间锚点行为观察 (21%) |
OCR 文字读取 (67%) |
CRITICAL |
| 8 |
Action Reasoning |
180 |
30 |
-- |
因果 why 推理 (36%) |
OCR/文字读取 (53%) |
CRITICAL |
| 9 |
Object Reasoning |
240 |
30 |
-- |
因果解释推理 (22%) |
OCR/文字读取 (57%) |
CRITICAL |
| 10 |
Temporal Reasoning |
91 |
30 |
-- |
严格序列排序 (52%) |
OCR/文字读取 (37%) |
CRITICAL |
| 11 |
Object Recognition |
54 |
30 |
-- |
否定/缺失检测 (30%) |
OCR/文字读取 (33%) |
HIGH |
| 12 |
Spatial Reasoning |
11 |
30 |
-- |
地理位置推断 (18%) |
OCR/文字读取 (30%) |
HIGH |
结论: 12 个题型全部存在 CRITICAL 或 HIGH 级别差距。6 个题型完全未覆盖;已覆盖的 6 个题型中,v2 的推理深度与 VME 严重错位。
推理深度对比(已覆盖的 6 个题型平均)
| 深度层级 |
VME 平均占比 |
v2 平均占比 |
差距 |
| single_frame |
8.0% |
66.1% |
v2 严重偏向单帧 |
| multi_frame |
25.4% |
15.6% |
略低 |
| cross_segment |
25.7% |
15.6% |
不足 |
| full_video |
41.0% |
2.8% |
v2 几乎为零 |
2. 逐题型分析
2.1 Information Synopsis (VME=163, v2=0) -- CRITICAL
- VME 特征: 79.8% full_video。主导模式为"视频主题识别"(61%),干扰项为同领域相邻主题(如 Gucci 纪录片选项含 Chanel/LV/Prada)。否定模式占 13.5%("哪个事件未被报道")。
- 差距诊断: v2 完全缺失。管线无任何摘要/主题/综述类 prompt 模板。
- 管线根因: REASONING 家族虽覆盖 Information Synopsis,但 L2 采样仅提供局部事件,无法支撑全局主题判断。prompt 中无综述类题目的具体指导。
2.2 Counting Problem (VME=48, v2=0) -- CRITICAL
- VME 特征: 72.9% full_video。要求在整个视频中持续追踪计数("Salah 出现了几个进球")。含条件过滤计数("独唱表演有几个")和陷阱题(答案为 0)。
- 差距诊断: v2 完全缺失。ENUMERATION 家族名义覆盖但
require_frames=False + cross_l2_span=False 产出文本计数题。
- 管线根因: 采样约束限制在单 L2 段内,无法产出需全视频追踪的计数题。无最小计数阈值或视觉计数要求。
2.3 Attribute Perception (VME=27, v2=0) -- CRITICAL
- VME 特征: 26% 为否定验证("以下哪项不正确"),需逐项核实 3-4 个事实。37% cross_segment。含情感/态度感知(从非语言线索推断情绪)。
- 差距诊断: v2 完全缺失。RETRIEVAL 和 VISUAL 家族名义覆盖但无属性感知专用指导。
- 管线根因: RETRIEVAL 中
require_frames=False,属性感知退化为文本检索。VISUAL 中 L3 单帧采样使属性观察过于简单。
2.4 OCR Problems (VME=14, v2=0) -- CRITICAL
- VME 特征: 50% single_frame 但要求精确数值/文字提取("半场比分 32-23"),干扰项数值接近(57.5/55/60 kg)。含时间锚定 OCR("罚球后比分")。
- 差距诊断: v2 完全缺失。讽刺的是 v2 已有的 6 个题型中大量问题实质上是 OCR 题(占 v2 总量 ~40%),但未被归类为 OCR。
- 管线根因: RETRIEVAL 和 VISUAL 覆盖 OCR 但无文字难度要求(大小、角度、遮挡)。L3 单帧 + 大字号文本 = 简单读取。
2.5 Temporal Perception (VME=6, v2=0) -- CRITICAL
- VME 特征: 83.3% cross_segment。事件时间定位("厨房事故发生在周几午餐?"),相对时长估计("哪款车占视频比例最大?")。
- 差距诊断: v2 完全缺失。管线无时间定位或时长估计模板。
- 管线根因: ENUMERATION 家族名义覆盖但 prompt 无时长/间隔/定位指导。
cross_l2_span=False 无法跨段生成。
2.6 Spatial Perception (VME=3, v2=0) -- CRITICAL
- VME 特征: 66.7% cross_segment。时空联合定位("左下角绿色模型何时出现")、物体目的地推理、相对朝向判断。
- 差距诊断: v2 完全缺失。管线无空间-时间交叉模板。
- 管线根因: SPATIAL 家族仅覆盖 Spatial Reasoning,Spatial Perception 未接入任何家族。
2.7 Action Recognition (VME=63, v2=30) -- CRITICAL
- VME 特征: 95.2% 多帧以上。主导模式为时间锚点行为观察 (21%)、否定/缺失 (17%)、事件机制 (17%)。
- v2 特征: 100% single_frame。67% 纯 OCR(球衣号码、排行榜文字)。无一题涉及动作序列或时序理解。
- 差距诊断: 题型根本错配 -- v2 测试静态视觉感知而非动作识别。截图模型即可满分。
- 管线根因: RETRIEVAL 家族 L3 采样 + "factual recall" prompt 产出单帧标签题。VISUAL 家族 L3 无法展示动作序列。
2.8 Action Reasoning (VME=180, v2=30) -- CRITICAL
- VME 特征: 0% single_frame。因果 why 推理占 36%,角色心理推断 10%,否定推理 8%,策略评估 7%。
- v2 特征: 53% single_frame(OCR 污染)。仅 3/30 题涉及因果推理。零角色动机/策略/隐喻推理。
- 差距诊断: 过半题目为错分类的 OCR/检索题。真正的推理题占比不足 10%。
- 管线根因: REASONING prompt 虽要求"multi-hop"但无结构性执行约束。
require_frames=False 使推理退化为文本提取。
2.9 Object Reasoning (VME=240, v2=30) -- CRITICAL
- VME 特征: 90% cross_segment 或 full_video。因果解释 (22%)、关系推断 (16%)、否定验证 (13%)、评价判断 (12%)。
- v2 特征: 56.7% single_frame。主导为 OCR (33%) 和物体属性识别 (23%)。仅 27% 涉及推理。
- 差距诊断: v2 的"物体推理"实为物体识别的错误标签。无因果链、无关系推断、无评价性判断。
- 管线根因: Object Reasoning 同时出现在 RETRIEVAL (L3, 禁止推理) 和 REASONING (L2) 两个家族,RETRIEVAL 产出的题目本质是识别题。
2.10 Temporal Reasoning (VME=91, v2=30) -- CRITICAL
- VME 特征: 72.5% full_video。严格序列排序占 52%("以下 5 项按什么顺序出现?"),日程重建 11%。
- v2 特征: 36.7% single_frame。零序列排序题。最好的题目是弱版"X 之后发生了什么"(只需链接两个时刻)。
- 差距诊断: VME 的核心模式(排列 3-5 项的顺序)在 v2 中完全缺失。v2 的"时序"题多为 OCR 或简单因果。
- 管线根因: ENUMERATION 家族
cross_l2_span=False 限制在单段内,无法收集多段时序材料。prompt 的"顺序"指导过于笼统。
2.11 Object Recognition (VME=54, v2=30) -- HIGH
- VME 特征: 75.9% cross_segment 或 full_video。否定/缺失检测 (30%)、全视频实体识别 (26%)。
- v2 特征: 63.3% single_frame。OCR/标签读取 (33%)、物体属性 (27%)。
- 差距诊断: VME 的"识别"意为"跨视频追踪并清点所有相关实体",v2 理解为"在帧中认出物体"。
- 管线根因: RETRIEVAL L3 + "直接可观察信息" prompt 产出最简单的识别题。
2.12 Spatial Reasoning (VME=11, v2=30) -- HIGH
- VME 特征: 72.7% multi_frame 或 full_video。从视觉线索推断地理位置、理解空间排列目的、估算距离。
- v2 特征: 86.7% single_frame。OCR (30%)、相对位置 (23%)、颜色识别 (17%)。
- 差距诊断: v2 测试"观察"(X 在 Y 左边),VME 测试"推断"(从建筑风格推断国家)。
- 管线根因: SPATIAL prompt 无推断层级要求。L1 采样与空间精度需求错位(应 L3 帧级 + 多帧序列)。
3. 管线系统性问题
3.1 Prompt 层问题
| 家族 |
核心缺陷 |
影响题型 |
| RETRIEVAL |
"factual recall" + "禁止 multi-hop" = 强制最简难度 |
AR/OR/ObjRec/AP/OCR |
| REASONING |
无结构性 multi-hop 执行约束(无最小跳数、无证据链格式) |
ActReas/ObjReas/InfoSyn |
| ENUMERATION |
计数/排序/时序/综述用同一泛化 prompt,无题型分支 |
Count/TempReas/TempPerc/InfoSyn |
| VISUAL |
无难度下限("什么颜色"即合法),无时序视觉变化要求 |
AP/Count/OCR/AR |
| SPATIAL |
Perception 与 Reasoning 用同一 prompt,无推断层级要求 |
SpatPerc/SpatReas |
| 全部 |
零题型分支: 5 个 prompt 均为题型无关,task_type 仅作元数据传入 |
全部 12 型 |
3.2 采样层问题
| 问题 |
具体表现 |
影响 |
| L3 单帧采样用于 4 个题型 |
AR/ObjRec/AP/OCR 在 RETRIEVAL 中均 L3 |
100% single_frame 退化 |
cross_l2_span=False 用于时序题 |
ENUMERATION 家族限制在单段 |
无法生成跨段排序/计数 |
require_frames=False 用于视觉题型 |
RETRIEVAL 中 AP/OCR/AR 不要求帧 |
视觉题退化为文本题 |
| 约束按家族统一,非按题型 |
同一家族内不同题型需求冲突 |
系统性错配 |
3.3 Gate 层问题
| Gate |
盲点 |
后果 |
| blind_answer |
只检测上下文泄露,不检测"有上下文也简单" |
大量 easy 题通过 |
| key_verify |
text OR frames 通过即可 |
视觉题型可纯文本回答 |
| leak_test |
按家族探测,非按题型 |
题型特有捷径未拦截 |
| heavy_check |
后置非阻塞,easy 题已接受 |
难度反馈无实际作用 |
| 缺失 |
无难度门控 gate |
简单题无任何拦截机制 |
| 缺失 |
无题集难度分布检查 |
无法控制 easy/med/hard 比例 |
4. 改进路线图
P0: 影响最大、立即可做
| # |
改进项 |
预期收益 |
实施方式 |
| P0-1 |
Prompt 内加入题型分支 |
消除"AR 出 OCR 题"等根本性错配 |
每个 prompt 增加 {% if task_type == "Action Recognition" %} 块,含题型专属规则和负面示例 |
| P0-2 |
修复采样约束为题型级 |
解除 L3/no-frame/no-cross 限制 |
SamplingConstraint 从 per-family 改为 per-(family, task_type),AR/AP/OCR 强制 require_frames=True,TempReas 强制 cross_l2_span=True |
| P0-3 |
提升 AR/ActReas/ObjReas 采样层级到 L2 |
从单帧提升到多帧 |
RETRIEVAL 中 AR/AP/OCR 改为 L2;VISUAL 中 AR 改为 L2 |
| P0-4 |
添加否定/缺失题模式 |
覆盖 VME 中占比 15-30% 的核心模式 |
新增 prompt 指令:"生成'以下哪项未在视频中出现'类型题目";需 full_video 采样支持 |
| P0-5 |
新增难度门控 gate |
直接过滤简单题 |
添加第 5 个 gate: 给 LLM 完整上下文,要求在 5 秒内作答;能秒答 = fail |
P1: 重要但需设计
| # |
改进项 |
预期收益 |
实施要点 |
| P1-1 |
新增 6 个缺失题型的 prompt 模板 |
覆盖率从 50% 提升到 100% |
InfoSynopsis: L1 全场景 + 主题合成;Counting: full_video + 视觉计数 + 条件过滤;AP: 否定验证 + 情感感知;OCR: 精确数值 + 时间锚定;TempPerc: 时间定位 + 时长估计;SpatPerc: 时空联合 + 朝向推理 |
| P1-2 |
创建独立 TEMPORAL 和 SYNOPSIS 家族 |
解除 ENUMERATION 对时序题的约束错配 |
TEMPORAL: cross_l2_span=True, L1 采样, 序列排序专用 prompt;SYNOPSIS: L1 全场景, 综述/主题/否定专用 prompt |
| P1-3 |
key_verify gate 按题型区分证据要求 |
视觉题型必须帧内有证据 |
AP/OCR/SpatPerc/AR: 改为 "evidence in frames ONLY";reasoning 类: 维持 "text OR frames" |
| P1-4 |
Prompt 加入难度校准示例 |
LLM 有锚定标准,避免难度地板 |
每个 prompt 附 2 个正面示例(medium/hard)和 2 个负面示例(too-easy),带评分理由 |
| P1-5 |
题集难度分布控制 |
确保 easy/med/hard 比例合理 |
后处理阶段按难度评分排序,按 20/50/30 目标裁剪,不足时重采 |
P1-6 重点:消除 Object Reasoning 在 RETRIEVAL 中的矛盾
将 Object Reasoning 从 RETRIEVAL 家族的 legal_task_types 中移除。Object Reasoning 只应出现在 REASONING 家族。当前双家族配置导致 ~50% 的 ObjReas 题目在"禁止推理"的 RETRIEVAL prompt 下生成,本质上是识别题。
P2: 长期架构改进
| # |
改进项 |
预期收益 |
复杂度 |
| P2-1 |
Full-video 采样路径 |
支持 full_video 深度题(VME 41% 需要) |
需新增 L0(整棵树)采样层,采集全视频摘要/时间线/实体清单作为 context |
| P2-2 |
将 heavy_check 改为前置阻塞 gate |
难度验证从抽检变为全量拦截 |
重构 gate pipeline,difficulty_steps 作为第 5 gate 的量化指标 |
| P2-3 |
引入"对抗性"题目生成 |
模拟 VME 的近距离干扰项设计 |
两阶段生成:先生成题目,再用另一 LLM 对抗性改写干扰项使其更接近正确答案 |
| P2-4 |
跨题型去重与平衡 |
消除"40% 的题实质是 OCR"的长尾效应 |
题目验收后做跨题型语义聚类,标记实质题型 vs 标注题型不一致的题目 |
优先级总结