# v2-360 vs Video-MME 出题质量差距分析报告 > 基线准确率 73.2% | v2 覆盖 6/12 类型 | VME 共 900 题 --- ## 1. 全局概览 | # | 题型 | VME 题数 | v2 题数 | VME 准确率 | VME 主导模式 | v2 主导模式 | 差距等级 | |---|------|---------|---------|-----------|-------------|------------|---------| | 1 | Information Synopsis | 163 | 0 | -- | 全局主题识别 (61%) | -- | **CRITICAL** | | 2 | Counting Problem | 48 | 0 | 50% | 全视频离散段计数 (29%) | -- | **CRITICAL** | | 3 | Attribute Perception | 27 | 0 | -- | 否定/假命题验证 (26%) | -- | **CRITICAL** | | 4 | OCR Problems | 14 | 0 | -- | 计分板/数值精确读取 (29%) | -- | **CRITICAL** | | 5 | Temporal Perception | 6 | 0 | 33% | 事件时间定位 (50%) | -- | **CRITICAL** | | 6 | Spatial Perception | 3 | 0 | 33% | 时空定位/朝向推理 (各33%) | -- | **CRITICAL** | | 7 | Action Recognition | 63 | 30 | -- | 时间锚点行为观察 (21%) | OCR 文字读取 (67%) | **CRITICAL** | | 8 | Action Reasoning | 180 | 30 | -- | 因果 why 推理 (36%) | OCR/文字读取 (53%) | **CRITICAL** | | 9 | Object Reasoning | 240 | 30 | -- | 因果解释推理 (22%) | OCR/文字读取 (57%) | **CRITICAL** | | 10 | Temporal Reasoning | 91 | 30 | -- | 严格序列排序 (52%) | OCR/文字读取 (37%) | **CRITICAL** | | 11 | Object Recognition | 54 | 30 | -- | 否定/缺失检测 (30%) | OCR/文字读取 (33%) | **HIGH** | | 12 | Spatial Reasoning | 11 | 30 | -- | 地理位置推断 (18%) | OCR/文字读取 (30%) | **HIGH** | **结论**: 12 个题型全部存在 CRITICAL 或 HIGH 级别差距。6 个题型完全未覆盖;已覆盖的 6 个题型中,v2 的推理深度与 VME 严重错位。 ### 推理深度对比(已覆盖的 6 个题型平均) | 深度层级 | VME 平均占比 | v2 平均占比 | 差距 | |---------|------------|-----------|------| | single_frame | 8.0% | **66.1%** | v2 严重偏向单帧 | | multi_frame | 25.4% | 15.6% | 略低 | | cross_segment | 25.7% | 15.6% | 不足 | | full_video | 41.0% | **2.8%** | v2 几乎为零 | --- ## 2. 逐题型分析 ### 2.1 Information Synopsis (VME=163, v2=0) -- CRITICAL - **VME 特征**: 79.8% full_video。主导模式为"视频主题识别"(61%),干扰项为同领域相邻主题(如 Gucci 纪录片选项含 Chanel/LV/Prada)。否定模式占 13.5%("哪个事件未被报道")。 - **差距诊断**: v2 完全缺失。管线无任何摘要/主题/综述类 prompt 模板。 - **管线根因**: REASONING 家族虽覆盖 Information Synopsis,但 L2 采样仅提供局部事件,无法支撑全局主题判断。prompt 中无综述类题目的具体指导。 ### 2.2 Counting Problem (VME=48, v2=0) -- CRITICAL - **VME 特征**: 72.9% full_video。要求在整个视频中持续追踪计数("Salah 出现了几个进球")。含条件过滤计数("独唱表演有几个")和陷阱题(答案为 0)。 - **差距诊断**: v2 完全缺失。ENUMERATION 家族名义覆盖但 `require_frames=False` + `cross_l2_span=False` 产出文本计数题。 - **管线根因**: 采样约束限制在单 L2 段内,无法产出需全视频追踪的计数题。无最小计数阈值或视觉计数要求。 ### 2.3 Attribute Perception (VME=27, v2=0) -- CRITICAL - **VME 特征**: 26% 为否定验证("以下哪项不正确"),需逐项核实 3-4 个事实。37% cross_segment。含情感/态度感知(从非语言线索推断情绪)。 - **差距诊断**: v2 完全缺失。RETRIEVAL 和 VISUAL 家族名义覆盖但无属性感知专用指导。 - **管线根因**: RETRIEVAL 中 `require_frames=False`,属性感知退化为文本检索。VISUAL 中 L3 单帧采样使属性观察过于简单。 ### 2.4 OCR Problems (VME=14, v2=0) -- CRITICAL - **VME 特征**: 50% single_frame 但要求精确数值/文字提取("半场比分 32-23"),干扰项数值接近(57.5/55/60 kg)。含时间锚定 OCR("罚球后比分")。 - **差距诊断**: v2 完全缺失。讽刺的是 v2 已有的 6 个题型中大量问题实质上是 OCR 题(占 v2 总量 ~40%),但未被归类为 OCR。 - **管线根因**: RETRIEVAL 和 VISUAL 覆盖 OCR 但无文字难度要求(大小、角度、遮挡)。L3 单帧 + 大字号文本 = 简单读取。 ### 2.5 Temporal Perception (VME=6, v2=0) -- CRITICAL - **VME 特征**: 83.3% cross_segment。事件时间定位("厨房事故发生在周几午餐?"),相对时长估计("哪款车占视频比例最大?")。 - **差距诊断**: v2 完全缺失。管线无时间定位或时长估计模板。 - **管线根因**: ENUMERATION 家族名义覆盖但 prompt 无时长/间隔/定位指导。`cross_l2_span=False` 无法跨段生成。 ### 2.6 Spatial Perception (VME=3, v2=0) -- CRITICAL - **VME 特征**: 66.7% cross_segment。时空联合定位("左下角绿色模型何时出现")、物体目的地推理、相对朝向判断。 - **差距诊断**: v2 完全缺失。管线无空间-时间交叉模板。 - **管线根因**: SPATIAL 家族仅覆盖 Spatial Reasoning,Spatial Perception 未接入任何家族。 ### 2.7 Action Recognition (VME=63, v2=30) -- CRITICAL - **VME 特征**: 95.2% 多帧以上。主导模式为时间锚点行为观察 (21%)、否定/缺失 (17%)、事件机制 (17%)。 - **v2 特征**: **100% single_frame**。67% 纯 OCR(球衣号码、排行榜文字)。无一题涉及动作序列或时序理解。 - **差距诊断**: 题型根本错配 -- v2 测试静态视觉感知而非动作识别。截图模型即可满分。 - **管线根因**: RETRIEVAL 家族 L3 采样 + "factual recall" prompt 产出单帧标签题。VISUAL 家族 L3 无法展示动作序列。 ### 2.8 Action Reasoning (VME=180, v2=30) -- CRITICAL - **VME 特征**: 0% single_frame。因果 why 推理占 36%,角色心理推断 10%,否定推理 8%,策略评估 7%。 - **v2 特征**: 53% single_frame(OCR 污染)。仅 3/30 题涉及因果推理。零角色动机/策略/隐喻推理。 - **差距诊断**: 过半题目为错分类的 OCR/检索题。真正的推理题占比不足 10%。 - **管线根因**: REASONING prompt 虽要求"multi-hop"但无结构性执行约束。`require_frames=False` 使推理退化为文本提取。 ### 2.9 Object Reasoning (VME=240, v2=30) -- CRITICAL - **VME 特征**: 90% cross_segment 或 full_video。因果解释 (22%)、关系推断 (16%)、否定验证 (13%)、评价判断 (12%)。 - **v2 特征**: 56.7% single_frame。主导为 OCR (33%) 和物体属性识别 (23%)。仅 27% 涉及推理。 - **差距诊断**: v2 的"物体推理"实为物体识别的错误标签。无因果链、无关系推断、无评价性判断。 - **管线根因**: Object Reasoning 同时出现在 RETRIEVAL (L3, 禁止推理) 和 REASONING (L2) 两个家族,RETRIEVAL 产出的题目本质是识别题。 ### 2.10 Temporal Reasoning (VME=91, v2=30) -- CRITICAL - **VME 特征**: 72.5% full_video。严格序列排序占 52%("以下 5 项按什么顺序出现?"),日程重建 11%。 - **v2 特征**: 36.7% single_frame。零序列排序题。最好的题目是弱版"X 之后发生了什么"(只需链接两个时刻)。 - **差距诊断**: VME 的核心模式(排列 3-5 项的顺序)在 v2 中完全缺失。v2 的"时序"题多为 OCR 或简单因果。 - **管线根因**: ENUMERATION 家族 `cross_l2_span=False` 限制在单段内,无法收集多段时序材料。prompt 的"顺序"指导过于笼统。 ### 2.11 Object Recognition (VME=54, v2=30) -- HIGH - **VME 特征**: 75.9% cross_segment 或 full_video。否定/缺失检测 (30%)、全视频实体识别 (26%)。 - **v2 特征**: 63.3% single_frame。OCR/标签读取 (33%)、物体属性 (27%)。 - **差距诊断**: VME 的"识别"意为"跨视频追踪并清点所有相关实体",v2 理解为"在帧中认出物体"。 - **管线根因**: RETRIEVAL L3 + "直接可观察信息" prompt 产出最简单的识别题。 ### 2.12 Spatial Reasoning (VME=11, v2=30) -- HIGH - **VME 特征**: 72.7% multi_frame 或 full_video。从视觉线索推断地理位置、理解空间排列目的、估算距离。 - **v2 特征**: 86.7% single_frame。OCR (30%)、相对位置 (23%)、颜色识别 (17%)。 - **差距诊断**: v2 测试"观察"(X 在 Y 左边),VME 测试"推断"(从建筑风格推断国家)。 - **管线根因**: SPATIAL prompt 无推断层级要求。L1 采样与空间精度需求错位(应 L3 帧级 + 多帧序列)。 --- ## 3. 管线系统性问题 ### 3.1 Prompt 层问题 | 家族 | 核心缺陷 | 影响题型 | |------|---------|---------| | RETRIEVAL | "factual recall" + "禁止 multi-hop" = 强制最简难度 | AR/OR/ObjRec/AP/OCR | | REASONING | 无结构性 multi-hop 执行约束(无最小跳数、无证据链格式) | ActReas/ObjReas/InfoSyn | | ENUMERATION | 计数/排序/时序/综述用同一泛化 prompt,无题型分支 | Count/TempReas/TempPerc/InfoSyn | | VISUAL | 无难度下限("什么颜色"即合法),无时序视觉变化要求 | AP/Count/OCR/AR | | SPATIAL | Perception 与 Reasoning 用同一 prompt,无推断层级要求 | SpatPerc/SpatReas | | **全部** | **零题型分支**: 5 个 prompt 均为题型无关,task_type 仅作元数据传入 | 全部 12 型 | ### 3.2 采样层问题 | 问题 | 具体表现 | 影响 | |------|---------|------| | L3 单帧采样用于 4 个题型 | AR/ObjRec/AP/OCR 在 RETRIEVAL 中均 L3 | 100% single_frame 退化 | | `cross_l2_span=False` 用于时序题 | ENUMERATION 家族限制在单段 | 无法生成跨段排序/计数 | | `require_frames=False` 用于视觉题型 | RETRIEVAL 中 AP/OCR/AR 不要求帧 | 视觉题退化为文本题 | | 约束按家族统一,非按题型 | 同一家族内不同题型需求冲突 | 系统性错配 | ### 3.3 Gate 层问题 | Gate | 盲点 | 后果 | |------|------|------| | blind_answer | 只检测上下文泄露,不检测"有上下文也简单" | 大量 easy 题通过 | | key_verify | text OR frames 通过即可 | 视觉题型可纯文本回答 | | leak_test | 按家族探测,非按题型 | 题型特有捷径未拦截 | | heavy_check | 后置非阻塞,easy 题已接受 | 难度反馈无实际作用 | | **缺失** | **无难度门控 gate** | 简单题无任何拦截机制 | | **缺失** | **无题集难度分布检查** | 无法控制 easy/med/hard 比例 | --- ## 4. 改进路线图 ### P0: 影响最大、立即可做 | # | 改进项 | 预期收益 | 实施方式 | |---|-------|---------|---------| | P0-1 | **Prompt 内加入题型分支** | 消除"AR 出 OCR 题"等根本性错配 | 每个 prompt 增加 `{% if task_type == "Action Recognition" %}` 块,含题型专属规则和负面示例 | | P0-2 | **修复采样约束为题型级** | 解除 L3/no-frame/no-cross 限制 | `SamplingConstraint` 从 per-family 改为 per-(family, task_type),AR/AP/OCR 强制 `require_frames=True`,TempReas 强制 `cross_l2_span=True` | | P0-3 | **提升 AR/ActReas/ObjReas 采样层级到 L2** | 从单帧提升到多帧 | RETRIEVAL 中 AR/AP/OCR 改为 L2;VISUAL 中 AR 改为 L2 | | P0-4 | **添加否定/缺失题模式** | 覆盖 VME 中占比 15-30% 的核心模式 | 新增 prompt 指令:"生成'以下哪项未在视频中出现'类型题目";需 full_video 采样支持 | | P0-5 | **新增难度门控 gate** | 直接过滤简单题 | 添加第 5 个 gate: 给 LLM 完整上下文,要求在 5 秒内作答;能秒答 = fail | ### P1: 重要但需设计 | # | 改进项 | 预期收益 | 实施要点 | |---|-------|---------|---------| | P1-1 | **新增 6 个缺失题型的 prompt 模板** | 覆盖率从 50% 提升到 100% | InfoSynopsis: L1 全场景 + 主题合成;Counting: full_video + 视觉计数 + 条件过滤;AP: 否定验证 + 情感感知;OCR: 精确数值 + 时间锚定;TempPerc: 时间定位 + 时长估计;SpatPerc: 时空联合 + 朝向推理 | | P1-2 | **创建独立 TEMPORAL 和 SYNOPSIS 家族** | 解除 ENUMERATION 对时序题的约束错配 | TEMPORAL: `cross_l2_span=True`, L1 采样, 序列排序专用 prompt;SYNOPSIS: L1 全场景, 综述/主题/否定专用 prompt | | P1-3 | **key_verify gate 按题型区分证据要求** | 视觉题型必须帧内有证据 | AP/OCR/SpatPerc/AR: 改为 "evidence in frames ONLY";reasoning 类: 维持 "text OR frames" | | P1-4 | **Prompt 加入难度校准示例** | LLM 有锚定标准,避免难度地板 | 每个 prompt 附 2 个正面示例(medium/hard)和 2 个负面示例(too-easy),带评分理由 | | P1-5 | **题集难度分布控制** | 确保 easy/med/hard 比例合理 | 后处理阶段按难度评分排序,按 20/50/30 目标裁剪,不足时重采 | ### P1-6 重点:消除 Object Reasoning 在 RETRIEVAL 中的矛盾 将 Object Reasoning 从 RETRIEVAL 家族的 `legal_task_types` 中移除。Object Reasoning 只应出现在 REASONING 家族。当前双家族配置导致 ~50% 的 ObjReas 题目在"禁止推理"的 RETRIEVAL prompt 下生成,本质上是识别题。 ### P2: 长期架构改进 | # | 改进项 | 预期收益 | 复杂度 | |---|-------|---------|-------| | P2-1 | **Full-video 采样路径** | 支持 full_video 深度题(VME 41% 需要) | 需新增 L0(整棵树)采样层,采集全视频摘要/时间线/实体清单作为 context | | P2-2 | **将 heavy_check 改为前置阻塞 gate** | 难度验证从抽检变为全量拦截 | 重构 gate pipeline,`difficulty_steps` 作为第 5 gate 的量化指标 | | P2-3 | **引入"对抗性"题目生成** | 模拟 VME 的近距离干扰项设计 | 两阶段生成:先生成题目,再用另一 LLM 对抗性改写干扰项使其更接近正确答案 | | P2-4 | **跨题型去重与平衡** | 消除"40% 的题实质是 OCR"的长尾效应 | 题目验收后做跨题型语义聚类,标记实质题型 vs 标注题型不一致的题目 | ### 优先级总结 ``` 立即执行 (P0, 1-2 天): P0-1 Prompt 题型分支 ──────────── 消除最严重的题型错配 P0-2 采样约束题型化 ──────────── 解除 L3/no-frame 限制 P0-3 提升采样层级 ────────────── 从单帧到多帧 P0-5 难度门控 gate ────────────── 直接拦截简单题 短期设计 (P1, 3-5 天): P1-1 新增 6 个缺失题型模板 ──── 覆盖率 50% -> 100% P1-2 新增 TEMPORAL/SYNOPSIS 家族 P1-4 Prompt 难度校准示例 中期架构 (P2, 1-2 周): P2-1 Full-video 采样路径 P2-3 对抗性干扰项生成 ```