Files
Video-Tree-TRM5/research-wiki/findings/2026-07-14-hard-distractor-literature.md
T

83 lines
6.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 困难干扰项生成文献调研:我们的病是 Easy-Options Bias,解法有成熟范式
- **日期**: 2026-07-14
- **触发**: [2026-07-14-ar30-too-easy-analysis.md] 的 action items 被评估为"治标、不够彻底",遂调研学界/开源如何生成真正困难、能靶向失败模式的多选题干扰项。
- **方法**: deep-research5 角度并行搜索 + 对抗验证,108 agents),6 篇核心论文已下载到 `reference/papers-distractor-gen/`GroundAttack 已精读。
## 一、核心结论:我们的病有学名,且解法与我们的"小修小补"根本不同
**我们"负空间干扰项 → 排除法秒杀"的病,学术名是 Easy-Options BiasEOB/ vision-option shortcut**:正确答案在特征空间比干扰项更贴近视觉内容,VLM 仅靠"vision+options 相似度匹配"就能选对、无需读题。GroundAttack 实测 NExT-QA(84.9%)、STAR(85.2%)、Video-MME 等 **80%+ 题有 EOB**——这不是我们独有的 bug,是整个多选 VQA 领域的系统病。
**关键差距**:我们原 action items 停留在"改 distractor prompt 文案 + 松绑门控"(要求 VLM 主观地"写得像")。学界的彻底解法是**用机制强制 grounded**,三条主线:
| 范式 | 一句话机制 | 代表 + 开源 | 消灭的捷径 |
|------|-----------|------------|-----------|
| **A. Grounded hard-negative mining** | 生成大量候选负选项 → 用 CLIP **视觉相似度**选出"与正解同样 groundable"的干扰项 | GroundAttack (2508.13428) | 排除法/单帧(vision-option 匹配) |
| **B. 对比最小对 / 单维反事实** | 正解与干扰项共享全部内容,只改**一个维度**(时序方向/顺序/速度/主体/方式/对象),是真实事件的 near-miss | TempCompass, VITATECS, Vinoground, DMC3 | 单帧可解 + 语言先验 |
| **C. 对抗过滤 + 配对翻转指标** | 门控从"唯一明显正确=过门"改为"能被 shortcut 秒杀=剔除";用配对翻转一致性(模型必须在正/反例间翻转)打分 | AFLite (2002.04108), QuadAcc, BVC, AdVQA | 一切 shortcut(模态无关) |
## 二、GroundAttack(已精读,最直接对口)
三个冻结模型协作,只替换负选项、保留原 V/Q/A:
| 模块 | 职责 | 我们的对应 |
|------|------|-----------|
| Captioner π_c | VLM 把视觉转详细文本描述 T | **已有**——树的 L2/L3 描述即是 |
| Distractor π_d | 给定 T+Q+ALLM 生成 **128 个** "confusing yet incorrect" 候选 | 我们只生成 3 个就落盘,无候选池 |
| Selector π_s | **Clustering+CLIP**:K-means 聚类候选文本 → 每组用 CLIP 选与视觉最相似的 → 得 hard negatives | **完全缺失**——这是消灭 EOB 的关键 |
**实测效果**EOB-free 标注后,VLM 在 (V+O) 设定掉到接近随机(20-30%5选1随机=20%),(V+Q+O) 掉到未饱和。**成本 8.75 美元**DeepSeek API 1.3e7 tokens)。核心洞察:**用 CLIP 视觉相似度选干扰项**,让干扰项和正解在视觉空间同样 groundable,排除法("搜不到就排除")从机制上失效——这正是我们最缺的一环。
## 三、落到我们 SubPattern + 门控架构的升级路径
### 3.1 出题层(替代"改 distractor_rules 文案"
**GroundAttack 式候选池 + 视觉相似度选择** 替代当前"VLM 直接写 3 个干扰项"
```
现状: VLM 一次生成 3 个干扰项 → 落盘(VLM 走最省力路径 = 负空间)
升级: 1. VLM 生成 N=32~128 个候选干扰项(都要求 grounded near-miss
2. 用现有 embeddingbge/CLIP)算每个候选 vs 采样帧的视觉相似度
3. 选出与正解视觉相似度最接近的 3 个 → 保证同样 groundable
4. EOB 自检:若正解的 vision-option 相似度显著 > 所有干扰项 → 退回重生成
```
**对比最小对(范式 B)作为 SubPattern 的结构约束**——每个 SubPattern 绑定一个"只改一维"的反事实模板:
- temporal_reasoning_failure → 只打乱事件**顺序**(同一组真实事件的错序排列,非缺席事件)
- fine_grained_visual_action → 只改**执行方式**(同动词的另一种真实做法)
- cross_segment_entity_tracking → 只改**主体**(另一实体在该段的真实动作)
### 3.2 门控层(替代"松绑 multi_true"
| 新增/改造门 | 机制 | 来源 |
|------------|------|------|
| **EOB 检测门** | 用 embedding 算 vision-option 相似度;正解不得显著比干扰项更贴近视觉,否则判"排除法可解"退回 | GroundAttack |
| **对抗过滤门(AFLite 式)** | 出题后用弱/中 agent 在 **(V+O) 不看问题** 设定试答;能秒杀=有 shortcut=剔除 | AFLite |
| **配对翻转一致性** 替代 multi_true 二元逻辑 | 同 SubPattern 造对比对(正例+反事实),模型必须翻转答案;不翻转=被 shortcut 攻破 | QuadAcc/BVC |
| **难度基线告警门** | 出题批次用当前 baseline agent 试答,正确率 >85% 触发告警 | 通用 |
## 四、已下载论文(`reference/papers-distractor-gen/`
| 文件 | 用途 | 状态 |
|------|------|------|
| GroundAttack_2508.13428.pdf | EOB 定义 + CLIP hard-negative mining(最对口) | ✅ 已精读 |
| TempCompass_2403.00476.pdf | 时序对比最小对三种构造法(反向/变速拼接/换序)+ 开源 | 待精读 |
| VITATECS_2311.17404.pdf | 六维度单维反事实描述 + 半自动 LLM+人工在环 + 开源 | 待精读 |
| AFLite_2002.04108.pdf | 对抗过滤剔除 shortcut-solvableSNLI 92→62% | 待精读 |
| Vinoground_2410.02763.pdf | 同词不同序时序反事实字幕对 | 待精读 |
| AdVQA_2106.00245.pdf | Dynabench 人机在环对抗采集 | 待精读 |
开源代码:`github.com/llyx97/TempCompass``github.com/lscpku/VITATECS`、GroundAttack(代码待放出)。
## 五、待解问题(调研未完全覆盖)
1. **通用长视频上如何低成本自动生成单维反事实**TempCompass 的反向/拼接技巧依赖"可反向播放/可拼接"的视频属性;主体/方式/对象维度的 grounded 扰动缺现成方法,需自研。
2. **区分"题真难"vs"题不可判定/歧义"**:把 agent 自身作为对抗器时,如何自动近似 VITATECS 的人类在环校验,保证 hard-but-answerable。
3. **单视频(非天然成对)语料如何构造配对翻转对**QuadAcc/BVC 依赖成对视频,我们是单视频,需为每个 SubPattern 生成配对反事实时间窗。
4. **IRT/难度校准反馈进出题器**:本次未找到强一级来源,需补充调研。
## 相关文件
- 前序诊断:[2026-07-14-ar30-too-easy-analysis.md](含 gate 树错配 bug、EOB 病灶量化)
- 论文:`reference/papers-distractor-gen/`
- 调研原始输出:workflow wf_110dfc64-98c