83 lines
6.6 KiB
Markdown
83 lines
6.6 KiB
Markdown
# 困难干扰项生成文献调研:我们的病是 Easy-Options Bias,解法有成熟范式
|
||
|
||
- **日期**: 2026-07-14
|
||
- **触发**: [2026-07-14-ar30-too-easy-analysis.md] 的 action items 被评估为"治标、不够彻底",遂调研学界/开源如何生成真正困难、能靶向失败模式的多选题干扰项。
|
||
- **方法**: deep-research(5 角度并行搜索 + 对抗验证,108 agents),6 篇核心论文已下载到 `reference/papers-distractor-gen/`,GroundAttack 已精读。
|
||
|
||
## 一、核心结论:我们的病有学名,且解法与我们的"小修小补"根本不同
|
||
|
||
**我们"负空间干扰项 → 排除法秒杀"的病,学术名是 Easy-Options Bias(EOB)/ vision-option shortcut**:正确答案在特征空间比干扰项更贴近视觉内容,VLM 仅靠"vision+options 相似度匹配"就能选对、无需读题。GroundAttack 实测 NExT-QA(84.9%)、STAR(85.2%)、Video-MME 等 **80%+ 题有 EOB**——这不是我们独有的 bug,是整个多选 VQA 领域的系统病。
|
||
|
||
**关键差距**:我们原 action items 停留在"改 distractor prompt 文案 + 松绑门控"(要求 VLM 主观地"写得像")。学界的彻底解法是**用机制强制 grounded**,三条主线:
|
||
|
||
| 范式 | 一句话机制 | 代表 + 开源 | 消灭的捷径 |
|
||
|------|-----------|------------|-----------|
|
||
| **A. Grounded hard-negative mining** | 生成大量候选负选项 → 用 CLIP **视觉相似度**选出"与正解同样 groundable"的干扰项 | GroundAttack (2508.13428) | 排除法/单帧(vision-option 匹配) |
|
||
| **B. 对比最小对 / 单维反事实** | 正解与干扰项共享全部内容,只改**一个维度**(时序方向/顺序/速度/主体/方式/对象),是真实事件的 near-miss | TempCompass, VITATECS, Vinoground, DMC3 | 单帧可解 + 语言先验 |
|
||
| **C. 对抗过滤 + 配对翻转指标** | 门控从"唯一明显正确=过门"改为"能被 shortcut 秒杀=剔除";用配对翻转一致性(模型必须在正/反例间翻转)打分 | AFLite (2002.04108), QuadAcc, BVC, AdVQA | 一切 shortcut(模态无关) |
|
||
|
||
## 二、GroundAttack(已精读,最直接对口)
|
||
|
||
三个冻结模型协作,只替换负选项、保留原 V/Q/A:
|
||
|
||
| 模块 | 职责 | 我们的对应 |
|
||
|------|------|-----------|
|
||
| Captioner π_c | VLM 把视觉转详细文本描述 T | **已有**——树的 L2/L3 描述即是 |
|
||
| Distractor π_d | 给定 T+Q+A,LLM 生成 **128 个** "confusing yet incorrect" 候选 | 我们只生成 3 个就落盘,无候选池 |
|
||
| Selector π_s | **Clustering+CLIP**:K-means 聚类候选文本 → 每组用 CLIP 选与视觉最相似的 → 得 hard negatives | **完全缺失**——这是消灭 EOB 的关键 |
|
||
|
||
**实测效果**:EOB-free 标注后,VLM 在 (V+O) 设定掉到接近随机(20-30%,5选1随机=20%),(V+Q+O) 掉到未饱和。**成本 8.75 美元**(DeepSeek API 1.3e7 tokens)。核心洞察:**用 CLIP 视觉相似度选干扰项**,让干扰项和正解在视觉空间同样 groundable,排除法("搜不到就排除")从机制上失效——这正是我们最缺的一环。
|
||
|
||
## 三、落到我们 SubPattern + 门控架构的升级路径
|
||
|
||
### 3.1 出题层(替代"改 distractor_rules 文案")
|
||
|
||
用 **GroundAttack 式候选池 + 视觉相似度选择** 替代当前"VLM 直接写 3 个干扰项":
|
||
|
||
```
|
||
现状: VLM 一次生成 3 个干扰项 → 落盘(VLM 走最省力路径 = 负空间)
|
||
升级: 1. VLM 生成 N=32~128 个候选干扰项(都要求 grounded near-miss)
|
||
2. 用现有 embedding(bge/CLIP)算每个候选 vs 采样帧的视觉相似度
|
||
3. 选出与正解视觉相似度最接近的 3 个 → 保证同样 groundable
|
||
4. EOB 自检:若正解的 vision-option 相似度显著 > 所有干扰项 → 退回重生成
|
||
```
|
||
|
||
**对比最小对(范式 B)作为 SubPattern 的结构约束**——每个 SubPattern 绑定一个"只改一维"的反事实模板:
|
||
- temporal_reasoning_failure → 只打乱事件**顺序**(同一组真实事件的错序排列,非缺席事件)
|
||
- fine_grained_visual_action → 只改**执行方式**(同动词的另一种真实做法)
|
||
- cross_segment_entity_tracking → 只改**主体**(另一实体在该段的真实动作)
|
||
|
||
### 3.2 门控层(替代"松绑 multi_true")
|
||
|
||
| 新增/改造门 | 机制 | 来源 |
|
||
|------------|------|------|
|
||
| **EOB 检测门** | 用 embedding 算 vision-option 相似度;正解不得显著比干扰项更贴近视觉,否则判"排除法可解"退回 | GroundAttack |
|
||
| **对抗过滤门(AFLite 式)** | 出题后用弱/中 agent 在 **(V+O) 不看问题** 设定试答;能秒杀=有 shortcut=剔除 | AFLite |
|
||
| **配对翻转一致性** 替代 multi_true 二元逻辑 | 同 SubPattern 造对比对(正例+反事实),模型必须翻转答案;不翻转=被 shortcut 攻破 | QuadAcc/BVC |
|
||
| **难度基线告警门** | 出题批次用当前 baseline agent 试答,正确率 >85% 触发告警 | 通用 |
|
||
|
||
## 四、已下载论文(`reference/papers-distractor-gen/`)
|
||
|
||
| 文件 | 用途 | 状态 |
|
||
|------|------|------|
|
||
| GroundAttack_2508.13428.pdf | EOB 定义 + CLIP hard-negative mining(最对口) | ✅ 已精读 |
|
||
| TempCompass_2403.00476.pdf | 时序对比最小对三种构造法(反向/变速拼接/换序)+ 开源 | 待精读 |
|
||
| VITATECS_2311.17404.pdf | 六维度单维反事实描述 + 半自动 LLM+人工在环 + 开源 | 待精读 |
|
||
| AFLite_2002.04108.pdf | 对抗过滤剔除 shortcut-solvable(SNLI 92→62%) | 待精读 |
|
||
| Vinoground_2410.02763.pdf | 同词不同序时序反事实字幕对 | 待精读 |
|
||
| AdVQA_2106.00245.pdf | Dynabench 人机在环对抗采集 | 待精读 |
|
||
|
||
开源代码:`github.com/llyx97/TempCompass`、`github.com/lscpku/VITATECS`、GroundAttack(代码待放出)。
|
||
|
||
## 五、待解问题(调研未完全覆盖)
|
||
|
||
1. **通用长视频上如何低成本自动生成单维反事实**:TempCompass 的反向/拼接技巧依赖"可反向播放/可拼接"的视频属性;主体/方式/对象维度的 grounded 扰动缺现成方法,需自研。
|
||
2. **区分"题真难"vs"题不可判定/歧义"**:把 agent 自身作为对抗器时,如何自动近似 VITATECS 的人类在环校验,保证 hard-but-answerable。
|
||
3. **单视频(非天然成对)语料如何构造配对翻转对**:QuadAcc/BVC 依赖成对视频,我们是单视频,需为每个 SubPattern 生成配对反事实时间窗。
|
||
4. **IRT/难度校准反馈进出题器**:本次未找到强一级来源,需补充调研。
|
||
|
||
## 相关文件
|
||
- 前序诊断:[2026-07-14-ar30-too-easy-analysis.md](含 gate 树错配 bug、EOB 病灶量化)
|
||
- 论文:`reference/papers-distractor-gen/`
|
||
- 调研原始输出:workflow wf_110dfc64-98c
|