Files
Video-Tree-TRM5/research-wiki/findings/2026-07-14-hard-distractor-literature.md

6.6 KiB
Raw Permalink Blame History

困难干扰项生成文献调研:我们的病是 Easy-Options Bias,解法有成熟范式

  • 日期: 2026-07-14
  • 触发: [2026-07-14-ar30-too-easy-analysis.md] 的 action items 被评估为"治标、不够彻底",遂调研学界/开源如何生成真正困难、能靶向失败模式的多选题干扰项。
  • 方法: deep-research5 角度并行搜索 + 对抗验证,108 agents),6 篇核心论文已下载到 reference/papers-distractor-gen/GroundAttack 已精读。

一、核心结论:我们的病有学名,且解法与我们的"小修小补"根本不同

我们"负空间干扰项 → 排除法秒杀"的病,学术名是 Easy-Options BiasEOB/ vision-option shortcut:正确答案在特征空间比干扰项更贴近视觉内容,VLM 仅靠"vision+options 相似度匹配"就能选对、无需读题。GroundAttack 实测 NExT-QA(84.9%)、STAR(85.2%)、Video-MME 等 80%+ 题有 EOB——这不是我们独有的 bug,是整个多选 VQA 领域的系统病。

关键差距:我们原 action items 停留在"改 distractor prompt 文案 + 松绑门控"(要求 VLM 主观地"写得像")。学界的彻底解法是用机制强制 grounded,三条主线:

范式 一句话机制 代表 + 开源 消灭的捷径
A. Grounded hard-negative mining 生成大量候选负选项 → 用 CLIP 视觉相似度选出"与正解同样 groundable"的干扰项 GroundAttack (2508.13428) 排除法/单帧(vision-option 匹配)
B. 对比最小对 / 单维反事实 正解与干扰项共享全部内容,只改一个维度(时序方向/顺序/速度/主体/方式/对象),是真实事件的 near-miss TempCompass, VITATECS, Vinoground, DMC3 单帧可解 + 语言先验
C. 对抗过滤 + 配对翻转指标 门控从"唯一明显正确=过门"改为"能被 shortcut 秒杀=剔除";用配对翻转一致性(模型必须在正/反例间翻转)打分 AFLite (2002.04108), QuadAcc, BVC, AdVQA 一切 shortcut(模态无关)

二、GroundAttack(已精读,最直接对口)

三个冻结模型协作,只替换负选项、保留原 V/Q/A:

模块 职责 我们的对应
Captioner π_c VLM 把视觉转详细文本描述 T 已有——树的 L2/L3 描述即是
Distractor π_d 给定 T+Q+ALLM 生成 128 个 "confusing yet incorrect" 候选 我们只生成 3 个就落盘,无候选池
Selector π_s Clustering+CLIP:K-means 聚类候选文本 → 每组用 CLIP 选与视觉最相似的 → 得 hard negatives 完全缺失——这是消灭 EOB 的关键

实测效果EOB-free 标注后,VLM 在 (V+O) 设定掉到接近随机(20-30%5选1随机=20%),(V+Q+O) 掉到未饱和。成本 8.75 美元DeepSeek API 1.3e7 tokens)。核心洞察:用 CLIP 视觉相似度选干扰项,让干扰项和正解在视觉空间同样 groundable,排除法("搜不到就排除")从机制上失效——这正是我们最缺的一环。

三、落到我们 SubPattern + 门控架构的升级路径

3.1 出题层(替代"改 distractor_rules 文案"

GroundAttack 式候选池 + 视觉相似度选择 替代当前"VLM 直接写 3 个干扰项"

现状:  VLM 一次生成 3 个干扰项 → 落盘(VLM 走最省力路径 = 负空间)
升级:  1. VLM 生成 N=32~128 个候选干扰项(都要求 grounded near-miss
       2. 用现有 embeddingbge/CLIP)算每个候选 vs 采样帧的视觉相似度
       3. 选出与正解视觉相似度最接近的 3 个 → 保证同样 groundable
       4. EOB 自检:若正解的 vision-option 相似度显著 > 所有干扰项 → 退回重生成

对比最小对(范式 B)作为 SubPattern 的结构约束——每个 SubPattern 绑定一个"只改一维"的反事实模板:

  • temporal_reasoning_failure → 只打乱事件顺序(同一组真实事件的错序排列,非缺席事件)
  • fine_grained_visual_action → 只改执行方式(同动词的另一种真实做法)
  • cross_segment_entity_tracking → 只改主体(另一实体在该段的真实动作)

3.2 门控层(替代"松绑 multi_true"

新增/改造门 机制 来源
EOB 检测门 用 embedding 算 vision-option 相似度;正解不得显著比干扰项更贴近视觉,否则判"排除法可解"退回 GroundAttack
对抗过滤门(AFLite 式) 出题后用弱/中 agent 在 (V+O) 不看问题 设定试答;能秒杀=有 shortcut=剔除 AFLite
配对翻转一致性 替代 multi_true 二元逻辑 同 SubPattern 造对比对(正例+反事实),模型必须翻转答案;不翻转=被 shortcut 攻破 QuadAcc/BVC
难度基线告警门 出题批次用当前 baseline agent 试答,正确率 >85% 触发告警 通用

四、已下载论文(reference/papers-distractor-gen/

文件 用途 状态
GroundAttack_2508.13428.pdf EOB 定义 + CLIP hard-negative mining(最对口) 已精读
TempCompass_2403.00476.pdf 时序对比最小对三种构造法(反向/变速拼接/换序)+ 开源 待精读
VITATECS_2311.17404.pdf 六维度单维反事实描述 + 半自动 LLM+人工在环 + 开源 待精读
AFLite_2002.04108.pdf 对抗过滤剔除 shortcut-solvableSNLI 92→62% 待精读
Vinoground_2410.02763.pdf 同词不同序时序反事实字幕对 待精读
AdVQA_2106.00245.pdf Dynabench 人机在环对抗采集 待精读

开源代码:github.com/llyx97/TempCompassgithub.com/lscpku/VITATECS、GroundAttack(代码待放出)。

五、待解问题(调研未完全覆盖)

  1. 通用长视频上如何低成本自动生成单维反事实TempCompass 的反向/拼接技巧依赖"可反向播放/可拼接"的视频属性;主体/方式/对象维度的 grounded 扰动缺现成方法,需自研。
  2. 区分"题真难"vs"题不可判定/歧义":把 agent 自身作为对抗器时,如何自动近似 VITATECS 的人类在环校验,保证 hard-but-answerable。
  3. 单视频(非天然成对)语料如何构造配对翻转对QuadAcc/BVC 依赖成对视频,我们是单视频,需为每个 SubPattern 生成配对反事实时间窗。
  4. IRT/难度校准反馈进出题器:本次未找到强一级来源,需补充调研。

相关文件

  • 前序诊断:[2026-07-14-ar30-too-easy-analysis.md](含 gate 树错配 bug、EOB 病灶量化)
  • 论文:reference/papers-distractor-gen/
  • 调研原始输出:workflow wf_110dfc64-98c