Files
Video-Tree-TRM5/research-wiki/findings/2026-07-14-question-quality-gap-analysis.md
T

14 KiB
Raw Blame History

v2-360 vs Video-MME 出题质量差距分析报告

基线准确率 73.2% | v2 覆盖 6/12 类型 | VME 共 900 题


1. 全局概览

# 题型 VME 题数 v2 题数 VME 准确率 VME 主导模式 v2 主导模式 差距等级
1 Information Synopsis 163 0 -- 全局主题识别 (61%) -- CRITICAL
2 Counting Problem 48 0 50% 全视频离散段计数 (29%) -- CRITICAL
3 Attribute Perception 27 0 -- 否定/假命题验证 (26%) -- CRITICAL
4 OCR Problems 14 0 -- 计分板/数值精确读取 (29%) -- CRITICAL
5 Temporal Perception 6 0 33% 事件时间定位 (50%) -- CRITICAL
6 Spatial Perception 3 0 33% 时空定位/朝向推理 (各33%) -- CRITICAL
7 Action Recognition 63 30 -- 时间锚点行为观察 (21%) OCR 文字读取 (67%) CRITICAL
8 Action Reasoning 180 30 -- 因果 why 推理 (36%) OCR/文字读取 (53%) CRITICAL
9 Object Reasoning 240 30 -- 因果解释推理 (22%) OCR/文字读取 (57%) CRITICAL
10 Temporal Reasoning 91 30 -- 严格序列排序 (52%) OCR/文字读取 (37%) CRITICAL
11 Object Recognition 54 30 -- 否定/缺失检测 (30%) OCR/文字读取 (33%) HIGH
12 Spatial Reasoning 11 30 -- 地理位置推断 (18%) OCR/文字读取 (30%) HIGH

结论: 12 个题型全部存在 CRITICAL 或 HIGH 级别差距。6 个题型完全未覆盖;已覆盖的 6 个题型中,v2 的推理深度与 VME 严重错位。

推理深度对比(已覆盖的 6 个题型平均)

深度层级 VME 平均占比 v2 平均占比 差距
single_frame 8.0% 66.1% v2 严重偏向单帧
multi_frame 25.4% 15.6% 略低
cross_segment 25.7% 15.6% 不足
full_video 41.0% 2.8% v2 几乎为零

2. 逐题型分析

2.1 Information Synopsis (VME=163, v2=0) -- CRITICAL

  • VME 特征: 79.8% full_video。主导模式为"视频主题识别"(61%),干扰项为同领域相邻主题(如 Gucci 纪录片选项含 Chanel/LV/Prada)。否定模式占 13.5%"哪个事件未被报道")。
  • 差距诊断: v2 完全缺失。管线无任何摘要/主题/综述类 prompt 模板。
  • 管线根因: REASONING 家族虽覆盖 Information Synopsis,但 L2 采样仅提供局部事件,无法支撑全局主题判断。prompt 中无综述类题目的具体指导。

2.2 Counting Problem (VME=48, v2=0) -- CRITICAL

  • VME 特征: 72.9% full_video。要求在整个视频中持续追踪计数("Salah 出现了几个进球")。含条件过滤计数("独唱表演有几个")和陷阱题(答案为 0)。
  • 差距诊断: v2 完全缺失。ENUMERATION 家族名义覆盖但 require_frames=False + cross_l2_span=False 产出文本计数题。
  • 管线根因: 采样约束限制在单 L2 段内,无法产出需全视频追踪的计数题。无最小计数阈值或视觉计数要求。

2.3 Attribute Perception (VME=27, v2=0) -- CRITICAL

  • VME 特征: 26% 为否定验证("以下哪项不正确"),需逐项核实 3-4 个事实。37% cross_segment。含情感/态度感知(从非语言线索推断情绪)。
  • 差距诊断: v2 完全缺失。RETRIEVAL 和 VISUAL 家族名义覆盖但无属性感知专用指导。
  • 管线根因: RETRIEVAL 中 require_frames=False,属性感知退化为文本检索。VISUAL 中 L3 单帧采样使属性观察过于简单。

2.4 OCR Problems (VME=14, v2=0) -- CRITICAL

  • VME 特征: 50% single_frame 但要求精确数值/文字提取("半场比分 32-23"),干扰项数值接近(57.5/55/60 kg)。含时间锚定 OCR"罚球后比分")。
  • 差距诊断: v2 完全缺失。讽刺的是 v2 已有的 6 个题型中大量问题实质上是 OCR 题(占 v2 总量 ~40%),但未被归类为 OCR。
  • 管线根因: RETRIEVAL 和 VISUAL 覆盖 OCR 但无文字难度要求(大小、角度、遮挡)。L3 单帧 + 大字号文本 = 简单读取。

2.5 Temporal Perception (VME=6, v2=0) -- CRITICAL

  • VME 特征: 83.3% cross_segment。事件时间定位("厨房事故发生在周几午餐?"),相对时长估计("哪款车占视频比例最大?")。
  • 差距诊断: v2 完全缺失。管线无时间定位或时长估计模板。
  • 管线根因: ENUMERATION 家族名义覆盖但 prompt 无时长/间隔/定位指导。cross_l2_span=False 无法跨段生成。

2.6 Spatial Perception (VME=3, v2=0) -- CRITICAL

  • VME 特征: 66.7% cross_segment。时空联合定位("左下角绿色模型何时出现")、物体目的地推理、相对朝向判断。
  • 差距诊断: v2 完全缺失。管线无空间-时间交叉模板。
  • 管线根因: SPATIAL 家族仅覆盖 Spatial ReasoningSpatial Perception 未接入任何家族。

2.7 Action Recognition (VME=63, v2=30) -- CRITICAL

  • VME 特征: 95.2% 多帧以上。主导模式为时间锚点行为观察 (21%)、否定/缺失 (17%)、事件机制 (17%)。
  • v2 特征: 100% single_frame。67% 纯 OCR(球衣号码、排行榜文字)。无一题涉及动作序列或时序理解。
  • 差距诊断: 题型根本错配 -- v2 测试静态视觉感知而非动作识别。截图模型即可满分。
  • 管线根因: RETRIEVAL 家族 L3 采样 + "factual recall" prompt 产出单帧标签题。VISUAL 家族 L3 无法展示动作序列。

2.8 Action Reasoning (VME=180, v2=30) -- CRITICAL

  • VME 特征: 0% single_frame。因果 why 推理占 36%,角色心理推断 10%,否定推理 8%,策略评估 7%。
  • v2 特征: 53% single_frameOCR 污染)。仅 3/30 题涉及因果推理。零角色动机/策略/隐喻推理。
  • 差距诊断: 过半题目为错分类的 OCR/检索题。真正的推理题占比不足 10%。
  • 管线根因: REASONING prompt 虽要求"multi-hop"但无结构性执行约束。require_frames=False 使推理退化为文本提取。

2.9 Object Reasoning (VME=240, v2=30) -- CRITICAL

  • VME 特征: 90% cross_segment 或 full_video。因果解释 (22%)、关系推断 (16%)、否定验证 (13%)、评价判断 (12%)。
  • v2 特征: 56.7% single_frame。主导为 OCR (33%) 和物体属性识别 (23%)。仅 27% 涉及推理。
  • 差距诊断: v2 的"物体推理"实为物体识别的错误标签。无因果链、无关系推断、无评价性判断。
  • 管线根因: Object Reasoning 同时出现在 RETRIEVAL (L3, 禁止推理) 和 REASONING (L2) 两个家族,RETRIEVAL 产出的题目本质是识别题。

2.10 Temporal Reasoning (VME=91, v2=30) -- CRITICAL

  • VME 特征: 72.5% full_video。严格序列排序占 52%("以下 5 项按什么顺序出现?"),日程重建 11%。
  • v2 特征: 36.7% single_frame。零序列排序题。最好的题目是弱版"X 之后发生了什么"(只需链接两个时刻)。
  • 差距诊断: VME 的核心模式(排列 3-5 项的顺序)在 v2 中完全缺失。v2 的"时序"题多为 OCR 或简单因果。
  • 管线根因: ENUMERATION 家族 cross_l2_span=False 限制在单段内,无法收集多段时序材料。prompt 的"顺序"指导过于笼统。

2.11 Object Recognition (VME=54, v2=30) -- HIGH

  • VME 特征: 75.9% cross_segment 或 full_video。否定/缺失检测 (30%)、全视频实体识别 (26%)。
  • v2 特征: 63.3% single_frame。OCR/标签读取 (33%)、物体属性 (27%)。
  • 差距诊断: VME 的"识别"意为"跨视频追踪并清点所有相关实体",v2 理解为"在帧中认出物体"。
  • 管线根因: RETRIEVAL L3 + "直接可观察信息" prompt 产出最简单的识别题。

2.12 Spatial Reasoning (VME=11, v2=30) -- HIGH

  • VME 特征: 72.7% multi_frame 或 full_video。从视觉线索推断地理位置、理解空间排列目的、估算距离。
  • v2 特征: 86.7% single_frame。OCR (30%)、相对位置 (23%)、颜色识别 (17%)。
  • 差距诊断: v2 测试"观察"X 在 Y 左边),VME 测试"推断"(从建筑风格推断国家)。
  • 管线根因: SPATIAL prompt 无推断层级要求。L1 采样与空间精度需求错位(应 L3 帧级 + 多帧序列)。

3. 管线系统性问题

3.1 Prompt 层问题

家族 核心缺陷 影响题型
RETRIEVAL "factual recall" + "禁止 multi-hop" = 强制最简难度 AR/OR/ObjRec/AP/OCR
REASONING 无结构性 multi-hop 执行约束(无最小跳数、无证据链格式) ActReas/ObjReas/InfoSyn
ENUMERATION 计数/排序/时序/综述用同一泛化 prompt,无题型分支 Count/TempReas/TempPerc/InfoSyn
VISUAL 无难度下限("什么颜色"即合法),无时序视觉变化要求 AP/Count/OCR/AR
SPATIAL Perception 与 Reasoning 用同一 prompt,无推断层级要求 SpatPerc/SpatReas
全部 零题型分支: 5 个 prompt 均为题型无关,task_type 仅作元数据传入 全部 12 型

3.2 采样层问题

问题 具体表现 影响
L3 单帧采样用于 4 个题型 AR/ObjRec/AP/OCR 在 RETRIEVAL 中均 L3 100% single_frame 退化
cross_l2_span=False 用于时序题 ENUMERATION 家族限制在单段 无法生成跨段排序/计数
require_frames=False 用于视觉题型 RETRIEVAL 中 AP/OCR/AR 不要求帧 视觉题退化为文本题
约束按家族统一,非按题型 同一家族内不同题型需求冲突 系统性错配

3.3 Gate 层问题

Gate 盲点 后果
blind_answer 只检测上下文泄露,不检测"有上下文也简单" 大量 easy 题通过
key_verify text OR frames 通过即可 视觉题型可纯文本回答
leak_test 按家族探测,非按题型 题型特有捷径未拦截
heavy_check 后置非阻塞,easy 题已接受 难度反馈无实际作用
缺失 无难度门控 gate 简单题无任何拦截机制
缺失 无题集难度分布检查 无法控制 easy/med/hard 比例

4. 改进路线图

P0: 影响最大、立即可做

# 改进项 预期收益 实施方式
P0-1 Prompt 内加入题型分支 消除"AR 出 OCR 题"等根本性错配 每个 prompt 增加 {% if task_type == "Action Recognition" %} 块,含题型专属规则和负面示例
P0-2 修复采样约束为题型级 解除 L3/no-frame/no-cross 限制 SamplingConstraint 从 per-family 改为 per-(family, task_type)AR/AP/OCR 强制 require_frames=TrueTempReas 强制 cross_l2_span=True
P0-3 提升 AR/ActReas/ObjReas 采样层级到 L2 从单帧提升到多帧 RETRIEVAL 中 AR/AP/OCR 改为 L2VISUAL 中 AR 改为 L2
P0-4 添加否定/缺失题模式 覆盖 VME 中占比 15-30% 的核心模式 新增 prompt 指令:"生成'以下哪项未在视频中出现'类型题目";需 full_video 采样支持
P0-5 新增难度门控 gate 直接过滤简单题 添加第 5 个 gate: 给 LLM 完整上下文,要求在 5 秒内作答;能秒答 = fail

P1: 重要但需设计

# 改进项 预期收益 实施要点
P1-1 新增 6 个缺失题型的 prompt 模板 覆盖率从 50% 提升到 100% InfoSynopsis: L1 全场景 + 主题合成;Counting: full_video + 视觉计数 + 条件过滤;AP: 否定验证 + 情感感知;OCR: 精确数值 + 时间锚定;TempPerc: 时间定位 + 时长估计;SpatPerc: 时空联合 + 朝向推理
P1-2 创建独立 TEMPORAL 和 SYNOPSIS 家族 解除 ENUMERATION 对时序题的约束错配 TEMPORAL: cross_l2_span=True, L1 采样, 序列排序专用 promptSYNOPSIS: L1 全场景, 综述/主题/否定专用 prompt
P1-3 key_verify gate 按题型区分证据要求 视觉题型必须帧内有证据 AP/OCR/SpatPerc/AR: 改为 "evidence in frames ONLY"reasoning 类: 维持 "text OR frames"
P1-4 Prompt 加入难度校准示例 LLM 有锚定标准,避免难度地板 每个 prompt 附 2 个正面示例(medium/hard)和 2 个负面示例(too-easy),带评分理由
P1-5 题集难度分布控制 确保 easy/med/hard 比例合理 后处理阶段按难度评分排序,按 20/50/30 目标裁剪,不足时重采

P1-6 重点:消除 Object Reasoning 在 RETRIEVAL 中的矛盾

将 Object Reasoning 从 RETRIEVAL 家族的 legal_task_types 中移除。Object Reasoning 只应出现在 REASONING 家族。当前双家族配置导致 ~50% 的 ObjReas 题目在"禁止推理"的 RETRIEVAL prompt 下生成,本质上是识别题。

P2: 长期架构改进

# 改进项 预期收益 复杂度
P2-1 Full-video 采样路径 支持 full_video 深度题(VME 41% 需要) 需新增 L0(整棵树)采样层,采集全视频摘要/时间线/实体清单作为 context
P2-2 将 heavy_check 改为前置阻塞 gate 难度验证从抽检变为全量拦截 重构 gate pipelinedifficulty_steps 作为第 5 gate 的量化指标
P2-3 引入"对抗性"题目生成 模拟 VME 的近距离干扰项设计 两阶段生成:先生成题目,再用另一 LLM 对抗性改写干扰项使其更接近正确答案
P2-4 跨题型去重与平衡 消除"40% 的题实质是 OCR"的长尾效应 题目验收后做跨题型语义聚类,标记实质题型 vs 标注题型不一致的题目

优先级总结

立即执行 (P0, 1-2 天):
  P0-1 Prompt 题型分支 ──────────── 消除最严重的题型错配
  P0-2 采样约束题型化 ──────────── 解除 L3/no-frame 限制
  P0-3 提升采样层级 ────────────── 从单帧到多帧
  P0-5 难度门控 gate ────────────── 直接拦截简单题

短期设计 (P1, 3-5 天):
  P1-1 新增 6 个缺失题型模板 ──── 覆盖率 50% -> 100%
  P1-2 新增 TEMPORAL/SYNOPSIS 家族
  P1-4 Prompt 难度校准示例

中期架构 (P2, 1-2 周):
  P2-1 Full-video 采样路径
  P2-3 对抗性干扰项生成