Complete v3 planning: construction-first paradigm (frame-perception grounded fact extraction + 4-family independent judges + 6-layer verification + QuestionUnit contract), adversarial audit, paradigm-shift finding, real-data spike validation, logging schema, and phase1 contract implementation plan.
8.3 KiB
id, title, type, created, status, supersedes-frame-of
| id | title | type | created | status | supersedes-frame-of |
|---|---|---|---|---|---|
| question-gen-paradigm-shift-construction-over-filtering | 出题范式转变 — 从"生成-打分-过滤"转向"构造优先 + 两正交独立信号"(六篇原文深读) | finding | 2026-07-15 | active | 2026-07-15-question-gen-v2-grounded-contrastive-design.md |
出题范式转变:构造优先,而非生成-过滤
触发:v2 设计 + Codex 修法经两轮对抗审核后,判定撞上两堵"结构性墙"(2 VLM 凑不出独立 grounding 裁判;所有门合取减产不可行区)。用户指出这是"工程补丁/表面模仿",要求回原文挖核心可行机制。遂对 6 篇论文做原文深读(非二手摘要)。
一、最关键的发现:两堵"墙"是错误框架的产物
v2 设计(含 Phase A、Codex 修法)自始至终是**"自由生成候选池 → 用裁判打分 → 过滤挑好的"。深读证明这是 AFLite 亲口认栽的死路:后置过滤的唯一信号(predictability)同时混入"真难题"和"歧义/烂题",一把尺量两样东西,拆不开——SNLI 过滤后人类精度反降 10 分**(Table 3),证明筛出的"难题"塞满连人都做不对的歧义题。
两堵墙只在这个框架里存在:
- 墙 1(凑不出独立 grounding 裁判) 只在"事后打分 grounding"时成立。构造范式里 grounding 由"锚定真实事实的最小编辑"保证,根本不需要 grounding 裁判。
- 墙 2(合取门减产不可行区) 只在"生成垃圾再硬过滤"时成立。构造正确 by design,yield 天然高,不需要一摞过滤门相乘。
二、两种可行范式(按子模式可构造性分流)
| 范式 | 代表论文 | grounding 由什么保证 | wrongness/唯一正解由什么保证 | 适用子模式 |
|---|---|---|---|---|
| A. 受控构造 | Vinoground / TempCompass / VITATECS | 对真实时序/结构事实做最小编辑 / 冲突孪生对,锚定真实事实 → 结构保证 | 单轴取值改变 / 孪生体互斥 → 结构保证 | 可锚定到结构化事件时序属性者(顺序/方向/次数/主宾/时序性位置) |
| B. 生成-独立筛选 | GroundAttack | 独立模型对真实帧的几何对齐度量(把干扰项视觉对齐度顶到正解水平,抹掉 EOB) | 无保证——它的已知软肋(§5 自认未验 wrongness);须外补独立核验 | 构造不了者(细粒度动作方式/纯感知) |
判定证据(构造 vs 过滤):
- Vinoground:caption 侧受控构造(GPT-4 硬约束"exact same words, only permuted"),video 侧检索+人工核验。非生成-过滤。
- TempCompass:纯受控构造(倒放/拼接/换序造冲突孪生),无生成后过滤,质量靠人工逐条校订。
- VITATECS:受控生成 + precision-over-recall 三级严过滤兜底(NLI + 微调判别器"正反双序一致"+ 人工改标)。
- GroundAttack:过量生成 128 + CLIP 视觉对齐筛 4。唯一的生成-筛选范式。
三、三根之前完全没有的新支柱(原文证据)
支柱 1:冲突孪生对 + 去捷径坍缩度量(TempCompass)
"A 的干扰项 = B(孪生体)的正确答案"——静态帧完全相同、只翻转时序,诱导 A 答对的捷径必让 B 答错,单帧偏置+语言先验被结构性对冲归零。有效性证明不是原始准确率,而是"加入冲突后掉回随机基线的幅度"(配对准确率/一致性)——纯算法/结构验证,不需循环裁判。Table 5 铁证:Image LLM 41-49%→35-41%(逼近随机 30)。
支柱 2:难度 vs 歧义 = 两个永不合并的正交独立信号(AdVQA)
- 难度信号 = 活求解器答错(对抗前移出题当下,骗不过就重写,5-tries 循环)。
- 质量/歧义信号 = 独立于求解器的多裁判答案一致性(10 标注者,<6 confident 且无共识→剔)。
- 核心不变量:答案核验器必须独立于被攻求解器,用多裁判一致性证伪答案唯一性。把"作弊门"做成"求解器既当难度裁判又当答案裁判"= 退回 AFLite 单信号困境。
- §4.5 直接证据:自动对抗无独立核验会制造答案漂移/歧义(Textfooler 错率 1.4% vs 人类闭环 38.1%)。
支柱 3:grounding 靠构造锚定真实事实(Vinoground/VITATECS/GroundAttack 共识)
"grounded"不来自"用了某模型打分",而来自:(A) 构造时锚定真实时序事实的最小编辑,或 (B) 独立模型对真实视觉证据的对齐度量。表面模仿"加个打分器"会漏掉:打分对象必须是"与真实视觉 V 的对齐度",且打分器必须独立且真的看帧;且打分器不顺带保证 wrongness(GroundAttack 软肋)。
四、原文的关键警告(防止再次表面模仿)
| 论文 | 警告 | 对我们的意义 |
|---|---|---|
| VITATECS Table 8 | 随机改 1 个名词→74.5-82.1% 可解;改词数 1→3→90.3% 可解;"cautions against purely lexical methods" | 反事实必须沿正交时序轴做等信息量、非蕴含的最小编辑;名词/属性替换必退化成静态捷径可解的伪难题 |
| VITATECS §3 | 纯静态感知(VISUAL/OCR/属性)没有时序轴可翻转,硬套单轴反事实会自败 | 不是所有 AR 子模式都适合构造范式;纯感知类需另想办法或剔除 |
| GroundAttack §5 | selector 只优化 grounding+多样性,wrongness 从未独立验证;CLIP 选出的"视觉最贴合"候选恰最可能是第二正解 | 生成-筛选范式必须外挂独立 wrongness 核验(对齐 AdVQA) |
| AFLite p8 | 过滤误删真易题 + 留下歧义题(人类精度降 10 分) | 后置作弊门只能兜底,不能当主力;质量必须构造/生成端保证 |
| TempCompass Table 5 | 沿用原始准确率会自欺 | 度量必须用配对/一致性/去捷径坍缩,而非单题准确率 |
五、对 6 个 AR 子模式的范式分流(初判,待 brainstorming 细化)
| 子模式 | 范式 | 构造手段 | 备注 |
|---|---|---|---|
| temporal_reasoning_failure | A 构造 | 树事件序列换序 → 冲突孪生对 + 双向 AND | 最佳适配(Vinoground/TempCompass Event-Order) |
| cross_segment_entity_tracking | A 构造 | 主宾互换 / first-last 翻转,保词袋 | Compositionality 最小编辑 |
| fine_grained_visual_action | B 生成-筛选 | qwen 过量生成 + MiniMax 看帧筛视觉对齐 + 独立 wrongness 核验 | 构造不了动作方式;2-VLM 独立性问题局限在此一个子模式 |
| premature_evidence_anchoring | A 构造(改造) | 段位随机 + 跨段唯一性;本质是"时序性锚点"单轴 | 需确保锚定时序而非静态 |
| evidence_gap_confabulation | 待定 | 二元(诚实 vs 虚构因果链),非静态感知 | 可能需独立设计;不套单轴反事实 |
| semantic_rigidity | 待定/可能剔除 | 唯一同义改写 vs 字幕陷阱——偏静态语义 | VITATECS 警告静态类不适合;重新评估是否保留 |
六、范式转变对 v2 设计的意义
现 v2 设计(2026-07-15-question-gen-v2-grounded-contrastive-design.md)的整个框架(生成-打分-过滤 + 事后 grounding 裁判 + 一摞合取门)被本 finding 取代。 新框架:
- 构造优先:能锚定到树的结构化事实的子模式,走"最小编辑 + 冲突孪生对",grounding/wrongness/唯一性由构造保证,绕开两堵墙。
- 生成-独立筛选仅用于构造不了的子模式(fine_grained),且必须解耦 grounding(看帧对齐)与 wrongness(独立核验)两道关卡。
- 难度/歧义两正交独立信号:难度=活求解器 Agent 答错(对抗前移,复用现有 AgentLoop);歧义=独立于求解器的多裁判/构造式答案唯一性核验。
- 度量革命:验收用配对准确率/去捷径坍缩(text-only 盲答、单帧基线掉回随机),纯算法,非循环裁判。
- LLM 角色收缩:从"自由发明干扰项"变为"对结构化树事实做受控最小编辑的表面实现 + 结构化属性抽取"。
相关
- 论文原文:
reference/papers-distractor-gen/(6 篇深读证据页码见各专读报告) - 被取代框架:[2026-07-15-question-gen-v2-grounded-contrastive-design.md]
- 前序审核:[2026-07-15-question-gen-v2-adversarial-audit.md]
- 前序诊断:[2026-07-15-question-gen-v2-diagnosis-and-strategy.md]