docs: add TaskTypeStrategy design + Plan A framework plan
This commit is contained in:
@@ -0,0 +1,206 @@
|
||||
# v2-360 vs Video-MME 出题质量差距分析报告
|
||||
|
||||
> 基线准确率 73.2% | v2 覆盖 6/12 类型 | VME 共 900 题
|
||||
|
||||
---
|
||||
|
||||
## 1. 全局概览
|
||||
|
||||
| # | 题型 | VME 题数 | v2 题数 | VME 准确率 | VME 主导模式 | v2 主导模式 | 差距等级 |
|
||||
|---|------|---------|---------|-----------|-------------|------------|---------|
|
||||
| 1 | Information Synopsis | 163 | 0 | -- | 全局主题识别 (61%) | -- | **CRITICAL** |
|
||||
| 2 | Counting Problem | 48 | 0 | 50% | 全视频离散段计数 (29%) | -- | **CRITICAL** |
|
||||
| 3 | Attribute Perception | 27 | 0 | -- | 否定/假命题验证 (26%) | -- | **CRITICAL** |
|
||||
| 4 | OCR Problems | 14 | 0 | -- | 计分板/数值精确读取 (29%) | -- | **CRITICAL** |
|
||||
| 5 | Temporal Perception | 6 | 0 | 33% | 事件时间定位 (50%) | -- | **CRITICAL** |
|
||||
| 6 | Spatial Perception | 3 | 0 | 33% | 时空定位/朝向推理 (各33%) | -- | **CRITICAL** |
|
||||
| 7 | Action Recognition | 63 | 30 | -- | 时间锚点行为观察 (21%) | OCR 文字读取 (67%) | **CRITICAL** |
|
||||
| 8 | Action Reasoning | 180 | 30 | -- | 因果 why 推理 (36%) | OCR/文字读取 (53%) | **CRITICAL** |
|
||||
| 9 | Object Reasoning | 240 | 30 | -- | 因果解释推理 (22%) | OCR/文字读取 (57%) | **CRITICAL** |
|
||||
| 10 | Temporal Reasoning | 91 | 30 | -- | 严格序列排序 (52%) | OCR/文字读取 (37%) | **CRITICAL** |
|
||||
| 11 | Object Recognition | 54 | 30 | -- | 否定/缺失检测 (30%) | OCR/文字读取 (33%) | **HIGH** |
|
||||
| 12 | Spatial Reasoning | 11 | 30 | -- | 地理位置推断 (18%) | OCR/文字读取 (30%) | **HIGH** |
|
||||
|
||||
**结论**: 12 个题型全部存在 CRITICAL 或 HIGH 级别差距。6 个题型完全未覆盖;已覆盖的 6 个题型中,v2 的推理深度与 VME 严重错位。
|
||||
|
||||
### 推理深度对比(已覆盖的 6 个题型平均)
|
||||
|
||||
| 深度层级 | VME 平均占比 | v2 平均占比 | 差距 |
|
||||
|---------|------------|-----------|------|
|
||||
| single_frame | 8.0% | **66.1%** | v2 严重偏向单帧 |
|
||||
| multi_frame | 25.4% | 15.6% | 略低 |
|
||||
| cross_segment | 25.7% | 15.6% | 不足 |
|
||||
| full_video | 41.0% | **2.8%** | v2 几乎为零 |
|
||||
|
||||
---
|
||||
|
||||
## 2. 逐题型分析
|
||||
|
||||
### 2.1 Information Synopsis (VME=163, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 79.8% full_video。主导模式为"视频主题识别"(61%),干扰项为同领域相邻主题(如 Gucci 纪录片选项含 Chanel/LV/Prada)。否定模式占 13.5%("哪个事件未被报道")。
|
||||
- **差距诊断**: v2 完全缺失。管线无任何摘要/主题/综述类 prompt 模板。
|
||||
- **管线根因**: REASONING 家族虽覆盖 Information Synopsis,但 L2 采样仅提供局部事件,无法支撑全局主题判断。prompt 中无综述类题目的具体指导。
|
||||
|
||||
### 2.2 Counting Problem (VME=48, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 72.9% full_video。要求在整个视频中持续追踪计数("Salah 出现了几个进球")。含条件过滤计数("独唱表演有几个")和陷阱题(答案为 0)。
|
||||
- **差距诊断**: v2 完全缺失。ENUMERATION 家族名义覆盖但 `require_frames=False` + `cross_l2_span=False` 产出文本计数题。
|
||||
- **管线根因**: 采样约束限制在单 L2 段内,无法产出需全视频追踪的计数题。无最小计数阈值或视觉计数要求。
|
||||
|
||||
### 2.3 Attribute Perception (VME=27, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 26% 为否定验证("以下哪项不正确"),需逐项核实 3-4 个事实。37% cross_segment。含情感/态度感知(从非语言线索推断情绪)。
|
||||
- **差距诊断**: v2 完全缺失。RETRIEVAL 和 VISUAL 家族名义覆盖但无属性感知专用指导。
|
||||
- **管线根因**: RETRIEVAL 中 `require_frames=False`,属性感知退化为文本检索。VISUAL 中 L3 单帧采样使属性观察过于简单。
|
||||
|
||||
### 2.4 OCR Problems (VME=14, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 50% single_frame 但要求精确数值/文字提取("半场比分 32-23"),干扰项数值接近(57.5/55/60 kg)。含时间锚定 OCR("罚球后比分")。
|
||||
- **差距诊断**: v2 完全缺失。讽刺的是 v2 已有的 6 个题型中大量问题实质上是 OCR 题(占 v2 总量 ~40%),但未被归类为 OCR。
|
||||
- **管线根因**: RETRIEVAL 和 VISUAL 覆盖 OCR 但无文字难度要求(大小、角度、遮挡)。L3 单帧 + 大字号文本 = 简单读取。
|
||||
|
||||
### 2.5 Temporal Perception (VME=6, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 83.3% cross_segment。事件时间定位("厨房事故发生在周几午餐?"),相对时长估计("哪款车占视频比例最大?")。
|
||||
- **差距诊断**: v2 完全缺失。管线无时间定位或时长估计模板。
|
||||
- **管线根因**: ENUMERATION 家族名义覆盖但 prompt 无时长/间隔/定位指导。`cross_l2_span=False` 无法跨段生成。
|
||||
|
||||
### 2.6 Spatial Perception (VME=3, v2=0) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 66.7% cross_segment。时空联合定位("左下角绿色模型何时出现")、物体目的地推理、相对朝向判断。
|
||||
- **差距诊断**: v2 完全缺失。管线无空间-时间交叉模板。
|
||||
- **管线根因**: SPATIAL 家族仅覆盖 Spatial Reasoning,Spatial Perception 未接入任何家族。
|
||||
|
||||
### 2.7 Action Recognition (VME=63, v2=30) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 95.2% 多帧以上。主导模式为时间锚点行为观察 (21%)、否定/缺失 (17%)、事件机制 (17%)。
|
||||
- **v2 特征**: **100% single_frame**。67% 纯 OCR(球衣号码、排行榜文字)。无一题涉及动作序列或时序理解。
|
||||
- **差距诊断**: 题型根本错配 -- v2 测试静态视觉感知而非动作识别。截图模型即可满分。
|
||||
- **管线根因**: RETRIEVAL 家族 L3 采样 + "factual recall" prompt 产出单帧标签题。VISUAL 家族 L3 无法展示动作序列。
|
||||
|
||||
### 2.8 Action Reasoning (VME=180, v2=30) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 0% single_frame。因果 why 推理占 36%,角色心理推断 10%,否定推理 8%,策略评估 7%。
|
||||
- **v2 特征**: 53% single_frame(OCR 污染)。仅 3/30 题涉及因果推理。零角色动机/策略/隐喻推理。
|
||||
- **差距诊断**: 过半题目为错分类的 OCR/检索题。真正的推理题占比不足 10%。
|
||||
- **管线根因**: REASONING prompt 虽要求"multi-hop"但无结构性执行约束。`require_frames=False` 使推理退化为文本提取。
|
||||
|
||||
### 2.9 Object Reasoning (VME=240, v2=30) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 90% cross_segment 或 full_video。因果解释 (22%)、关系推断 (16%)、否定验证 (13%)、评价判断 (12%)。
|
||||
- **v2 特征**: 56.7% single_frame。主导为 OCR (33%) 和物体属性识别 (23%)。仅 27% 涉及推理。
|
||||
- **差距诊断**: v2 的"物体推理"实为物体识别的错误标签。无因果链、无关系推断、无评价性判断。
|
||||
- **管线根因**: Object Reasoning 同时出现在 RETRIEVAL (L3, 禁止推理) 和 REASONING (L2) 两个家族,RETRIEVAL 产出的题目本质是识别题。
|
||||
|
||||
### 2.10 Temporal Reasoning (VME=91, v2=30) -- CRITICAL
|
||||
|
||||
- **VME 特征**: 72.5% full_video。严格序列排序占 52%("以下 5 项按什么顺序出现?"),日程重建 11%。
|
||||
- **v2 特征**: 36.7% single_frame。零序列排序题。最好的题目是弱版"X 之后发生了什么"(只需链接两个时刻)。
|
||||
- **差距诊断**: VME 的核心模式(排列 3-5 项的顺序)在 v2 中完全缺失。v2 的"时序"题多为 OCR 或简单因果。
|
||||
- **管线根因**: ENUMERATION 家族 `cross_l2_span=False` 限制在单段内,无法收集多段时序材料。prompt 的"顺序"指导过于笼统。
|
||||
|
||||
### 2.11 Object Recognition (VME=54, v2=30) -- HIGH
|
||||
|
||||
- **VME 特征**: 75.9% cross_segment 或 full_video。否定/缺失检测 (30%)、全视频实体识别 (26%)。
|
||||
- **v2 特征**: 63.3% single_frame。OCR/标签读取 (33%)、物体属性 (27%)。
|
||||
- **差距诊断**: VME 的"识别"意为"跨视频追踪并清点所有相关实体",v2 理解为"在帧中认出物体"。
|
||||
- **管线根因**: RETRIEVAL L3 + "直接可观察信息" prompt 产出最简单的识别题。
|
||||
|
||||
### 2.12 Spatial Reasoning (VME=11, v2=30) -- HIGH
|
||||
|
||||
- **VME 特征**: 72.7% multi_frame 或 full_video。从视觉线索推断地理位置、理解空间排列目的、估算距离。
|
||||
- **v2 特征**: 86.7% single_frame。OCR (30%)、相对位置 (23%)、颜色识别 (17%)。
|
||||
- **差距诊断**: v2 测试"观察"(X 在 Y 左边),VME 测试"推断"(从建筑风格推断国家)。
|
||||
- **管线根因**: SPATIAL prompt 无推断层级要求。L1 采样与空间精度需求错位(应 L3 帧级 + 多帧序列)。
|
||||
|
||||
---
|
||||
|
||||
## 3. 管线系统性问题
|
||||
|
||||
### 3.1 Prompt 层问题
|
||||
|
||||
| 家族 | 核心缺陷 | 影响题型 |
|
||||
|------|---------|---------|
|
||||
| RETRIEVAL | "factual recall" + "禁止 multi-hop" = 强制最简难度 | AR/OR/ObjRec/AP/OCR |
|
||||
| REASONING | 无结构性 multi-hop 执行约束(无最小跳数、无证据链格式) | ActReas/ObjReas/InfoSyn |
|
||||
| ENUMERATION | 计数/排序/时序/综述用同一泛化 prompt,无题型分支 | Count/TempReas/TempPerc/InfoSyn |
|
||||
| VISUAL | 无难度下限("什么颜色"即合法),无时序视觉变化要求 | AP/Count/OCR/AR |
|
||||
| SPATIAL | Perception 与 Reasoning 用同一 prompt,无推断层级要求 | SpatPerc/SpatReas |
|
||||
| **全部** | **零题型分支**: 5 个 prompt 均为题型无关,task_type 仅作元数据传入 | 全部 12 型 |
|
||||
|
||||
### 3.2 采样层问题
|
||||
|
||||
| 问题 | 具体表现 | 影响 |
|
||||
|------|---------|------|
|
||||
| L3 单帧采样用于 4 个题型 | AR/ObjRec/AP/OCR 在 RETRIEVAL 中均 L3 | 100% single_frame 退化 |
|
||||
| `cross_l2_span=False` 用于时序题 | ENUMERATION 家族限制在单段 | 无法生成跨段排序/计数 |
|
||||
| `require_frames=False` 用于视觉题型 | RETRIEVAL 中 AP/OCR/AR 不要求帧 | 视觉题退化为文本题 |
|
||||
| 约束按家族统一,非按题型 | 同一家族内不同题型需求冲突 | 系统性错配 |
|
||||
|
||||
### 3.3 Gate 层问题
|
||||
|
||||
| Gate | 盲点 | 后果 |
|
||||
|------|------|------|
|
||||
| blind_answer | 只检测上下文泄露,不检测"有上下文也简单" | 大量 easy 题通过 |
|
||||
| key_verify | text OR frames 通过即可 | 视觉题型可纯文本回答 |
|
||||
| leak_test | 按家族探测,非按题型 | 题型特有捷径未拦截 |
|
||||
| heavy_check | 后置非阻塞,easy 题已接受 | 难度反馈无实际作用 |
|
||||
| **缺失** | **无难度门控 gate** | 简单题无任何拦截机制 |
|
||||
| **缺失** | **无题集难度分布检查** | 无法控制 easy/med/hard 比例 |
|
||||
|
||||
---
|
||||
|
||||
## 4. 改进路线图
|
||||
|
||||
### P0: 影响最大、立即可做
|
||||
|
||||
| # | 改进项 | 预期收益 | 实施方式 |
|
||||
|---|-------|---------|---------|
|
||||
| P0-1 | **Prompt 内加入题型分支** | 消除"AR 出 OCR 题"等根本性错配 | 每个 prompt 增加 `{% if task_type == "Action Recognition" %}` 块,含题型专属规则和负面示例 |
|
||||
| P0-2 | **修复采样约束为题型级** | 解除 L3/no-frame/no-cross 限制 | `SamplingConstraint` 从 per-family 改为 per-(family, task_type),AR/AP/OCR 强制 `require_frames=True`,TempReas 强制 `cross_l2_span=True` |
|
||||
| P0-3 | **提升 AR/ActReas/ObjReas 采样层级到 L2** | 从单帧提升到多帧 | RETRIEVAL 中 AR/AP/OCR 改为 L2;VISUAL 中 AR 改为 L2 |
|
||||
| P0-4 | **添加否定/缺失题模式** | 覆盖 VME 中占比 15-30% 的核心模式 | 新增 prompt 指令:"生成'以下哪项未在视频中出现'类型题目";需 full_video 采样支持 |
|
||||
| P0-5 | **新增难度门控 gate** | 直接过滤简单题 | 添加第 5 个 gate: 给 LLM 完整上下文,要求在 5 秒内作答;能秒答 = fail |
|
||||
|
||||
### P1: 重要但需设计
|
||||
|
||||
| # | 改进项 | 预期收益 | 实施要点 |
|
||||
|---|-------|---------|---------|
|
||||
| P1-1 | **新增 6 个缺失题型的 prompt 模板** | 覆盖率从 50% 提升到 100% | InfoSynopsis: L1 全场景 + 主题合成;Counting: full_video + 视觉计数 + 条件过滤;AP: 否定验证 + 情感感知;OCR: 精确数值 + 时间锚定;TempPerc: 时间定位 + 时长估计;SpatPerc: 时空联合 + 朝向推理 |
|
||||
| P1-2 | **创建独立 TEMPORAL 和 SYNOPSIS 家族** | 解除 ENUMERATION 对时序题的约束错配 | TEMPORAL: `cross_l2_span=True`, L1 采样, 序列排序专用 prompt;SYNOPSIS: L1 全场景, 综述/主题/否定专用 prompt |
|
||||
| P1-3 | **key_verify gate 按题型区分证据要求** | 视觉题型必须帧内有证据 | AP/OCR/SpatPerc/AR: 改为 "evidence in frames ONLY";reasoning 类: 维持 "text OR frames" |
|
||||
| P1-4 | **Prompt 加入难度校准示例** | LLM 有锚定标准,避免难度地板 | 每个 prompt 附 2 个正面示例(medium/hard)和 2 个负面示例(too-easy),带评分理由 |
|
||||
| P1-5 | **题集难度分布控制** | 确保 easy/med/hard 比例合理 | 后处理阶段按难度评分排序,按 20/50/30 目标裁剪,不足时重采 |
|
||||
|
||||
### P1-6 重点:消除 Object Reasoning 在 RETRIEVAL 中的矛盾
|
||||
|
||||
将 Object Reasoning 从 RETRIEVAL 家族的 `legal_task_types` 中移除。Object Reasoning 只应出现在 REASONING 家族。当前双家族配置导致 ~50% 的 ObjReas 题目在"禁止推理"的 RETRIEVAL prompt 下生成,本质上是识别题。
|
||||
|
||||
### P2: 长期架构改进
|
||||
|
||||
| # | 改进项 | 预期收益 | 复杂度 |
|
||||
|---|-------|---------|-------|
|
||||
| P2-1 | **Full-video 采样路径** | 支持 full_video 深度题(VME 41% 需要) | 需新增 L0(整棵树)采样层,采集全视频摘要/时间线/实体清单作为 context |
|
||||
| P2-2 | **将 heavy_check 改为前置阻塞 gate** | 难度验证从抽检变为全量拦截 | 重构 gate pipeline,`difficulty_steps` 作为第 5 gate 的量化指标 |
|
||||
| P2-3 | **引入"对抗性"题目生成** | 模拟 VME 的近距离干扰项设计 | 两阶段生成:先生成题目,再用另一 LLM 对抗性改写干扰项使其更接近正确答案 |
|
||||
| P2-4 | **跨题型去重与平衡** | 消除"40% 的题实质是 OCR"的长尾效应 | 题目验收后做跨题型语义聚类,标记实质题型 vs 标注题型不一致的题目 |
|
||||
|
||||
### 优先级总结
|
||||
|
||||
```
|
||||
立即执行 (P0, 1-2 天):
|
||||
P0-1 Prompt 题型分支 ──────────── 消除最严重的题型错配
|
||||
P0-2 采样约束题型化 ──────────── 解除 L3/no-frame 限制
|
||||
P0-3 提升采样层级 ────────────── 从单帧到多帧
|
||||
P0-5 难度门控 gate ────────────── 直接拦截简单题
|
||||
|
||||
短期设计 (P1, 3-5 天):
|
||||
P1-1 新增 6 个缺失题型模板 ──── 覆盖率 50% -> 100%
|
||||
P1-2 新增 TEMPORAL/SYNOPSIS 家族
|
||||
P1-4 Prompt 难度校准示例
|
||||
|
||||
中期架构 (P2, 1-2 周):
|
||||
P2-1 Full-video 采样路径
|
||||
P2-3 对抗性干扰项生成
|
||||
```
|
||||
Reference in New Issue
Block a user