Files
Video-Tree-TRM5/research-wiki/findings/2026-07-14-question-quality-gap-analysis.md
T

207 lines
14 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# v2-360 vs Video-MME 出题质量差距分析报告
> 基线准确率 73.2% | v2 覆盖 6/12 类型 | VME 共 900 题
---
## 1. 全局概览
| # | 题型 | VME 题数 | v2 题数 | VME 准确率 | VME 主导模式 | v2 主导模式 | 差距等级 |
|---|------|---------|---------|-----------|-------------|------------|---------|
| 1 | Information Synopsis | 163 | 0 | -- | 全局主题识别 (61%) | -- | **CRITICAL** |
| 2 | Counting Problem | 48 | 0 | 50% | 全视频离散段计数 (29%) | -- | **CRITICAL** |
| 3 | Attribute Perception | 27 | 0 | -- | 否定/假命题验证 (26%) | -- | **CRITICAL** |
| 4 | OCR Problems | 14 | 0 | -- | 计分板/数值精确读取 (29%) | -- | **CRITICAL** |
| 5 | Temporal Perception | 6 | 0 | 33% | 事件时间定位 (50%) | -- | **CRITICAL** |
| 6 | Spatial Perception | 3 | 0 | 33% | 时空定位/朝向推理 (各33%) | -- | **CRITICAL** |
| 7 | Action Recognition | 63 | 30 | -- | 时间锚点行为观察 (21%) | OCR 文字读取 (67%) | **CRITICAL** |
| 8 | Action Reasoning | 180 | 30 | -- | 因果 why 推理 (36%) | OCR/文字读取 (53%) | **CRITICAL** |
| 9 | Object Reasoning | 240 | 30 | -- | 因果解释推理 (22%) | OCR/文字读取 (57%) | **CRITICAL** |
| 10 | Temporal Reasoning | 91 | 30 | -- | 严格序列排序 (52%) | OCR/文字读取 (37%) | **CRITICAL** |
| 11 | Object Recognition | 54 | 30 | -- | 否定/缺失检测 (30%) | OCR/文字读取 (33%) | **HIGH** |
| 12 | Spatial Reasoning | 11 | 30 | -- | 地理位置推断 (18%) | OCR/文字读取 (30%) | **HIGH** |
**结论**: 12 个题型全部存在 CRITICAL 或 HIGH 级别差距。6 个题型完全未覆盖;已覆盖的 6 个题型中,v2 的推理深度与 VME 严重错位。
### 推理深度对比(已覆盖的 6 个题型平均)
| 深度层级 | VME 平均占比 | v2 平均占比 | 差距 |
|---------|------------|-----------|------|
| single_frame | 8.0% | **66.1%** | v2 严重偏向单帧 |
| multi_frame | 25.4% | 15.6% | 略低 |
| cross_segment | 25.7% | 15.6% | 不足 |
| full_video | 41.0% | **2.8%** | v2 几乎为零 |
---
## 2. 逐题型分析
### 2.1 Information Synopsis (VME=163, v2=0) -- CRITICAL
- **VME 特征**: 79.8% full_video。主导模式为"视频主题识别"(61%),干扰项为同领域相邻主题(如 Gucci 纪录片选项含 Chanel/LV/Prada)。否定模式占 13.5%"哪个事件未被报道")。
- **差距诊断**: v2 完全缺失。管线无任何摘要/主题/综述类 prompt 模板。
- **管线根因**: REASONING 家族虽覆盖 Information Synopsis,但 L2 采样仅提供局部事件,无法支撑全局主题判断。prompt 中无综述类题目的具体指导。
### 2.2 Counting Problem (VME=48, v2=0) -- CRITICAL
- **VME 特征**: 72.9% full_video。要求在整个视频中持续追踪计数("Salah 出现了几个进球")。含条件过滤计数("独唱表演有几个")和陷阱题(答案为 0)。
- **差距诊断**: v2 完全缺失。ENUMERATION 家族名义覆盖但 `require_frames=False` + `cross_l2_span=False` 产出文本计数题。
- **管线根因**: 采样约束限制在单 L2 段内,无法产出需全视频追踪的计数题。无最小计数阈值或视觉计数要求。
### 2.3 Attribute Perception (VME=27, v2=0) -- CRITICAL
- **VME 特征**: 26% 为否定验证("以下哪项不正确"),需逐项核实 3-4 个事实。37% cross_segment。含情感/态度感知(从非语言线索推断情绪)。
- **差距诊断**: v2 完全缺失。RETRIEVAL 和 VISUAL 家族名义覆盖但无属性感知专用指导。
- **管线根因**: RETRIEVAL 中 `require_frames=False`,属性感知退化为文本检索。VISUAL 中 L3 单帧采样使属性观察过于简单。
### 2.4 OCR Problems (VME=14, v2=0) -- CRITICAL
- **VME 特征**: 50% single_frame 但要求精确数值/文字提取("半场比分 32-23"),干扰项数值接近(57.5/55/60 kg)。含时间锚定 OCR"罚球后比分")。
- **差距诊断**: v2 完全缺失。讽刺的是 v2 已有的 6 个题型中大量问题实质上是 OCR 题(占 v2 总量 ~40%),但未被归类为 OCR。
- **管线根因**: RETRIEVAL 和 VISUAL 覆盖 OCR 但无文字难度要求(大小、角度、遮挡)。L3 单帧 + 大字号文本 = 简单读取。
### 2.5 Temporal Perception (VME=6, v2=0) -- CRITICAL
- **VME 特征**: 83.3% cross_segment。事件时间定位("厨房事故发生在周几午餐?"),相对时长估计("哪款车占视频比例最大?")。
- **差距诊断**: v2 完全缺失。管线无时间定位或时长估计模板。
- **管线根因**: ENUMERATION 家族名义覆盖但 prompt 无时长/间隔/定位指导。`cross_l2_span=False` 无法跨段生成。
### 2.6 Spatial Perception (VME=3, v2=0) -- CRITICAL
- **VME 特征**: 66.7% cross_segment。时空联合定位("左下角绿色模型何时出现")、物体目的地推理、相对朝向判断。
- **差距诊断**: v2 完全缺失。管线无空间-时间交叉模板。
- **管线根因**: SPATIAL 家族仅覆盖 Spatial ReasoningSpatial Perception 未接入任何家族。
### 2.7 Action Recognition (VME=63, v2=30) -- CRITICAL
- **VME 特征**: 95.2% 多帧以上。主导模式为时间锚点行为观察 (21%)、否定/缺失 (17%)、事件机制 (17%)。
- **v2 特征**: **100% single_frame**。67% 纯 OCR(球衣号码、排行榜文字)。无一题涉及动作序列或时序理解。
- **差距诊断**: 题型根本错配 -- v2 测试静态视觉感知而非动作识别。截图模型即可满分。
- **管线根因**: RETRIEVAL 家族 L3 采样 + "factual recall" prompt 产出单帧标签题。VISUAL 家族 L3 无法展示动作序列。
### 2.8 Action Reasoning (VME=180, v2=30) -- CRITICAL
- **VME 特征**: 0% single_frame。因果 why 推理占 36%,角色心理推断 10%,否定推理 8%,策略评估 7%。
- **v2 特征**: 53% single_frameOCR 污染)。仅 3/30 题涉及因果推理。零角色动机/策略/隐喻推理。
- **差距诊断**: 过半题目为错分类的 OCR/检索题。真正的推理题占比不足 10%。
- **管线根因**: REASONING prompt 虽要求"multi-hop"但无结构性执行约束。`require_frames=False` 使推理退化为文本提取。
### 2.9 Object Reasoning (VME=240, v2=30) -- CRITICAL
- **VME 特征**: 90% cross_segment 或 full_video。因果解释 (22%)、关系推断 (16%)、否定验证 (13%)、评价判断 (12%)。
- **v2 特征**: 56.7% single_frame。主导为 OCR (33%) 和物体属性识别 (23%)。仅 27% 涉及推理。
- **差距诊断**: v2 的"物体推理"实为物体识别的错误标签。无因果链、无关系推断、无评价性判断。
- **管线根因**: Object Reasoning 同时出现在 RETRIEVAL (L3, 禁止推理) 和 REASONING (L2) 两个家族,RETRIEVAL 产出的题目本质是识别题。
### 2.10 Temporal Reasoning (VME=91, v2=30) -- CRITICAL
- **VME 特征**: 72.5% full_video。严格序列排序占 52%("以下 5 项按什么顺序出现?"),日程重建 11%。
- **v2 特征**: 36.7% single_frame。零序列排序题。最好的题目是弱版"X 之后发生了什么"(只需链接两个时刻)。
- **差距诊断**: VME 的核心模式(排列 3-5 项的顺序)在 v2 中完全缺失。v2 的"时序"题多为 OCR 或简单因果。
- **管线根因**: ENUMERATION 家族 `cross_l2_span=False` 限制在单段内,无法收集多段时序材料。prompt 的"顺序"指导过于笼统。
### 2.11 Object Recognition (VME=54, v2=30) -- HIGH
- **VME 特征**: 75.9% cross_segment 或 full_video。否定/缺失检测 (30%)、全视频实体识别 (26%)。
- **v2 特征**: 63.3% single_frame。OCR/标签读取 (33%)、物体属性 (27%)。
- **差距诊断**: VME 的"识别"意为"跨视频追踪并清点所有相关实体",v2 理解为"在帧中认出物体"。
- **管线根因**: RETRIEVAL L3 + "直接可观察信息" prompt 产出最简单的识别题。
### 2.12 Spatial Reasoning (VME=11, v2=30) -- HIGH
- **VME 特征**: 72.7% multi_frame 或 full_video。从视觉线索推断地理位置、理解空间排列目的、估算距离。
- **v2 特征**: 86.7% single_frame。OCR (30%)、相对位置 (23%)、颜色识别 (17%)。
- **差距诊断**: v2 测试"观察"X 在 Y 左边),VME 测试"推断"(从建筑风格推断国家)。
- **管线根因**: SPATIAL prompt 无推断层级要求。L1 采样与空间精度需求错位(应 L3 帧级 + 多帧序列)。
---
## 3. 管线系统性问题
### 3.1 Prompt 层问题
| 家族 | 核心缺陷 | 影响题型 |
|------|---------|---------|
| RETRIEVAL | "factual recall" + "禁止 multi-hop" = 强制最简难度 | AR/OR/ObjRec/AP/OCR |
| REASONING | 无结构性 multi-hop 执行约束(无最小跳数、无证据链格式) | ActReas/ObjReas/InfoSyn |
| ENUMERATION | 计数/排序/时序/综述用同一泛化 prompt,无题型分支 | Count/TempReas/TempPerc/InfoSyn |
| VISUAL | 无难度下限("什么颜色"即合法),无时序视觉变化要求 | AP/Count/OCR/AR |
| SPATIAL | Perception 与 Reasoning 用同一 prompt,无推断层级要求 | SpatPerc/SpatReas |
| **全部** | **零题型分支**: 5 个 prompt 均为题型无关,task_type 仅作元数据传入 | 全部 12 型 |
### 3.2 采样层问题
| 问题 | 具体表现 | 影响 |
|------|---------|------|
| L3 单帧采样用于 4 个题型 | AR/ObjRec/AP/OCR 在 RETRIEVAL 中均 L3 | 100% single_frame 退化 |
| `cross_l2_span=False` 用于时序题 | ENUMERATION 家族限制在单段 | 无法生成跨段排序/计数 |
| `require_frames=False` 用于视觉题型 | RETRIEVAL 中 AP/OCR/AR 不要求帧 | 视觉题退化为文本题 |
| 约束按家族统一,非按题型 | 同一家族内不同题型需求冲突 | 系统性错配 |
### 3.3 Gate 层问题
| Gate | 盲点 | 后果 |
|------|------|------|
| blind_answer | 只检测上下文泄露,不检测"有上下文也简单" | 大量 easy 题通过 |
| key_verify | text OR frames 通过即可 | 视觉题型可纯文本回答 |
| leak_test | 按家族探测,非按题型 | 题型特有捷径未拦截 |
| heavy_check | 后置非阻塞,easy 题已接受 | 难度反馈无实际作用 |
| **缺失** | **无难度门控 gate** | 简单题无任何拦截机制 |
| **缺失** | **无题集难度分布检查** | 无法控制 easy/med/hard 比例 |
---
## 4. 改进路线图
### P0: 影响最大、立即可做
| # | 改进项 | 预期收益 | 实施方式 |
|---|-------|---------|---------|
| P0-1 | **Prompt 内加入题型分支** | 消除"AR 出 OCR 题"等根本性错配 | 每个 prompt 增加 `{% if task_type == "Action Recognition" %}` 块,含题型专属规则和负面示例 |
| P0-2 | **修复采样约束为题型级** | 解除 L3/no-frame/no-cross 限制 | `SamplingConstraint` 从 per-family 改为 per-(family, task_type)AR/AP/OCR 强制 `require_frames=True`TempReas 强制 `cross_l2_span=True` |
| P0-3 | **提升 AR/ActReas/ObjReas 采样层级到 L2** | 从单帧提升到多帧 | RETRIEVAL 中 AR/AP/OCR 改为 L2VISUAL 中 AR 改为 L2 |
| P0-4 | **添加否定/缺失题模式** | 覆盖 VME 中占比 15-30% 的核心模式 | 新增 prompt 指令:"生成'以下哪项未在视频中出现'类型题目";需 full_video 采样支持 |
| P0-5 | **新增难度门控 gate** | 直接过滤简单题 | 添加第 5 个 gate: 给 LLM 完整上下文,要求在 5 秒内作答;能秒答 = fail |
### P1: 重要但需设计
| # | 改进项 | 预期收益 | 实施要点 |
|---|-------|---------|---------|
| P1-1 | **新增 6 个缺失题型的 prompt 模板** | 覆盖率从 50% 提升到 100% | InfoSynopsis: L1 全场景 + 主题合成;Counting: full_video + 视觉计数 + 条件过滤;AP: 否定验证 + 情感感知;OCR: 精确数值 + 时间锚定;TempPerc: 时间定位 + 时长估计;SpatPerc: 时空联合 + 朝向推理 |
| P1-2 | **创建独立 TEMPORAL 和 SYNOPSIS 家族** | 解除 ENUMERATION 对时序题的约束错配 | TEMPORAL: `cross_l2_span=True`, L1 采样, 序列排序专用 promptSYNOPSIS: L1 全场景, 综述/主题/否定专用 prompt |
| P1-3 | **key_verify gate 按题型区分证据要求** | 视觉题型必须帧内有证据 | AP/OCR/SpatPerc/AR: 改为 "evidence in frames ONLY"reasoning 类: 维持 "text OR frames" |
| P1-4 | **Prompt 加入难度校准示例** | LLM 有锚定标准,避免难度地板 | 每个 prompt 附 2 个正面示例(medium/hard)和 2 个负面示例(too-easy),带评分理由 |
| P1-5 | **题集难度分布控制** | 确保 easy/med/hard 比例合理 | 后处理阶段按难度评分排序,按 20/50/30 目标裁剪,不足时重采 |
### P1-6 重点:消除 Object Reasoning 在 RETRIEVAL 中的矛盾
将 Object Reasoning 从 RETRIEVAL 家族的 `legal_task_types` 中移除。Object Reasoning 只应出现在 REASONING 家族。当前双家族配置导致 ~50% 的 ObjReas 题目在"禁止推理"的 RETRIEVAL prompt 下生成,本质上是识别题。
### P2: 长期架构改进
| # | 改进项 | 预期收益 | 复杂度 |
|---|-------|---------|-------|
| P2-1 | **Full-video 采样路径** | 支持 full_video 深度题(VME 41% 需要) | 需新增 L0(整棵树)采样层,采集全视频摘要/时间线/实体清单作为 context |
| P2-2 | **将 heavy_check 改为前置阻塞 gate** | 难度验证从抽检变为全量拦截 | 重构 gate pipeline`difficulty_steps` 作为第 5 gate 的量化指标 |
| P2-3 | **引入"对抗性"题目生成** | 模拟 VME 的近距离干扰项设计 | 两阶段生成:先生成题目,再用另一 LLM 对抗性改写干扰项使其更接近正确答案 |
| P2-4 | **跨题型去重与平衡** | 消除"40% 的题实质是 OCR"的长尾效应 | 题目验收后做跨题型语义聚类,标记实质题型 vs 标注题型不一致的题目 |
### 优先级总结
```
立即执行 (P0, 1-2 天):
P0-1 Prompt 题型分支 ──────────── 消除最严重的题型错配
P0-2 采样约束题型化 ──────────── 解除 L3/no-frame 限制
P0-3 提升采样层级 ────────────── 从单帧到多帧
P0-5 难度门控 gate ────────────── 直接拦截简单题
短期设计 (P1, 3-5 天):
P1-1 新增 6 个缺失题型模板 ──── 覆盖率 50% -> 100%
P1-2 新增 TEMPORAL/SYNOPSIS 家族
P1-4 Prompt 难度校准示例
中期架构 (P2, 1-2 周):
P2-1 Full-video 采样路径
P2-3 对抗性干扰项生成
```