--- id: question-gen-paradigm-shift-construction-over-filtering title: 出题范式转变 — 从"生成-打分-过滤"转向"构造优先 + 两正交独立信号"(六篇原文深读) type: finding created: 2026-07-15 status: active supersedes-frame-of: 2026-07-15-question-gen-v2-grounded-contrastive-design.md --- # 出题范式转变:构造优先,而非生成-过滤 **触发**:v2 设计 + Codex 修法经两轮对抗审核后,判定撞上两堵"结构性墙"(2 VLM 凑不出独立 grounding 裁判;所有门合取减产不可行区)。用户指出这是"工程补丁/表面模仿",要求回原文挖核心可行机制。遂对 6 篇论文做原文深读(非二手摘要)。 ## 一、最关键的发现:两堵"墙"是错误框架的产物 v2 设计(含 Phase A、Codex 修法)自始至终是**"自由生成候选池 → 用裁判打分 → 过滤挑好的"**。深读证明这是 **AFLite 亲口认栽的死路**:后置过滤的唯一信号(predictability)同时混入"真难题"和"歧义/烂题",一把尺量两样东西,拆不开——SNLI 过滤后**人类精度反降 10 分**(Table 3),证明筛出的"难题"塞满连人都做不对的歧义题。 两堵墙只在这个框架里存在: - **墙 1(凑不出独立 grounding 裁判)** 只在"事后打分 grounding"时成立。构造范式里 grounding 由"锚定真实事实的最小编辑"保证,**根本不需要 grounding 裁判**。 - **墙 2(合取门减产不可行区)** 只在"生成垃圾再硬过滤"时成立。构造正确 by design,yield 天然高,不需要一摞过滤门相乘。 ## 二、两种可行范式(按子模式可构造性分流) | 范式 | 代表论文 | grounding 由什么保证 | wrongness/唯一正解由什么保证 | 适用子模式 | |------|---------|---------------------|---------------------------|-----------| | **A. 受控构造** | Vinoground / TempCompass / VITATECS | 对真实时序/结构事实做**最小编辑** / **冲突孪生对**,锚定真实事实 → 结构保证 | 单轴取值改变 / 孪生体互斥 → **结构保证** | 可锚定到结构化事件时序属性者(顺序/方向/次数/主宾/时序性位置) | | **B. 生成-独立筛选** | GroundAttack | 独立模型对**真实帧的几何对齐度量**(把干扰项视觉对齐度顶到正解水平,抹掉 EOB) | **无保证——它的已知软肋**(§5 自认未验 wrongness);须外补独立核验 | 构造不了者(细粒度动作方式/纯感知) | **判定证据(构造 vs 过滤)**: - Vinoground:caption 侧受控构造(GPT-4 硬约束"exact same words, only permuted"),video 侧检索+人工核验。非生成-过滤。 - TempCompass:纯受控构造(倒放/拼接/换序造冲突孪生),无生成后过滤,质量靠人工逐条校订。 - VITATECS:受控生成 + precision-over-recall 三级严过滤兜底(NLI + 微调判别器"正反双序一致"+ 人工改标)。 - GroundAttack:过量生成 128 + CLIP 视觉对齐筛 4。**唯一的生成-筛选范式**。 ## 三、三根之前完全没有的新支柱(原文证据) ### 支柱 1:冲突孪生对 + 去捷径坍缩度量(TempCompass) "A 的干扰项 = B(孪生体)的正确答案"——静态帧完全相同、只翻转时序,**诱导 A 答对的捷径必让 B 答错**,单帧偏置+语言先验被结构性对冲归零。**有效性证明不是原始准确率,而是"加入冲突后掉回随机基线的幅度"(配对准确率/一致性)**——纯算法/结构验证,不需循环裁判。Table 5 铁证:Image LLM 41-49%→35-41%(逼近随机 30)。 ### 支柱 2:难度 vs 歧义 = 两个永不合并的正交独立信号(AdVQA) - 难度信号 = 活求解器答错(对抗前移出题当下,骗不过就重写,5-tries 循环)。 - 质量/歧义信号 = **独立于求解器的多裁判答案一致性**(10 标注者,<6 confident 且无共识→剔)。 - **核心不变量**:答案核验器**必须独立于被攻求解器**,用多裁判一致性证伪答案唯一性。把"作弊门"做成"求解器既当难度裁判又当答案裁判"= 退回 AFLite 单信号困境。 - §4.5 直接证据:自动对抗无独立核验会制造答案漂移/歧义(Textfooler 错率 1.4% vs 人类闭环 38.1%)。 ### 支柱 3:grounding 靠构造锚定真实事实(Vinoground/VITATECS/GroundAttack 共识) "grounded"不来自"用了某模型打分",而来自:(A) 构造时锚定真实时序事实的最小编辑,或 (B) 独立模型对真实视觉证据的对齐度量。**表面模仿"加个打分器"会漏掉:打分对象必须是"与真实视觉 V 的对齐度",且打分器必须独立且真的看帧;且打分器不顺带保证 wrongness(GroundAttack 软肋)**。 ## 四、原文的关键警告(防止再次表面模仿) | 论文 | 警告 | 对我们的意义 | |------|------|------------| | VITATECS Table 8 | 随机改 1 个名词→74.5-82.1% 可解;改词数 1→3→90.3% 可解;"cautions against purely lexical methods" | 反事实必须沿**正交时序轴**做等信息量、非蕴含的**最小编辑**;名词/属性替换必退化成静态捷径可解的伪难题 | | VITATECS §3 | 纯静态感知(VISUAL/OCR/属性)**没有时序轴可翻转**,硬套单轴反事实会自败 | 不是所有 AR 子模式都适合构造范式;纯感知类需另想办法或剔除 | | GroundAttack §5 | selector 只优化 grounding+多样性,**wrongness 从未独立验证**;CLIP 选出的"视觉最贴合"候选恰最可能是第二正解 | 生成-筛选范式必须**外挂独立 wrongness 核验**(对齐 AdVQA) | | AFLite p8 | 过滤误删真易题 + 留下歧义题(人类精度降 10 分) | 后置作弊门只能兜底,不能当主力;质量必须构造/生成端保证 | | TempCompass Table 5 | 沿用原始准确率会自欺 | 度量必须用配对/一致性/去捷径坍缩,而非单题准确率 | ## 五、对 6 个 AR 子模式的范式分流(初判,待 brainstorming 细化) | 子模式 | 范式 | 构造手段 | 备注 | |--------|------|---------|------| | temporal_reasoning_failure | **A 构造** | 树事件序列换序 → 冲突孪生对 + 双向 AND | 最佳适配(Vinoground/TempCompass Event-Order) | | cross_segment_entity_tracking | **A 构造** | 主宾互换 / first-last 翻转,保词袋 | Compositionality 最小编辑 | | fine_grained_visual_action | **B 生成-筛选** | qwen 过量生成 + MiniMax 看帧筛视觉对齐 + 独立 wrongness 核验 | 构造不了动作方式;2-VLM 独立性问题局限在此一个子模式 | | premature_evidence_anchoring | **A 构造(改造)** | 段位随机 + 跨段唯一性;本质是"时序性锚点"单轴 | 需确保锚定时序而非静态 | | evidence_gap_confabulation | **待定** | 二元(诚实 vs 虚构因果链),非静态感知 | 可能需独立设计;不套单轴反事实 | | semantic_rigidity | **待定/可能剔除** | 唯一同义改写 vs 字幕陷阱——偏静态语义 | VITATECS 警告静态类不适合;重新评估是否保留 | ## 六、范式转变对 v2 设计的意义 **现 v2 设计(2026-07-15-question-gen-v2-grounded-contrastive-design.md)的整个框架(生成-打分-过滤 + 事后 grounding 裁判 + 一摞合取门)被本 finding 取代。** 新框架: 1. **构造优先**:能锚定到树的结构化事实的子模式,走"最小编辑 + 冲突孪生对",grounding/wrongness/唯一性由构造保证,绕开两堵墙。 2. **生成-独立筛选仅用于构造不了的子模式**(fine_grained),且必须解耦 grounding(看帧对齐)与 wrongness(独立核验)两道关卡。 3. **难度/歧义两正交独立信号**:难度=活求解器 Agent 答错(对抗前移,复用现有 AgentLoop);歧义=独立于求解器的多裁判/构造式答案唯一性核验。 4. **度量革命**:验收用配对准确率/去捷径坍缩(text-only 盲答、单帧基线掉回随机),纯算法,非循环裁判。 5. **LLM 角色收缩**:从"自由发明干扰项"变为"对结构化树事实做受控最小编辑的表面实现 + 结构化属性抽取"。 ## 相关 - 论文原文:`reference/papers-distractor-gen/`(6 篇深读证据页码见各专读报告) - 被取代框架:[2026-07-15-question-gen-v2-grounded-contrastive-design.md] - 前序审核:[2026-07-15-question-gen-v2-adversarial-audit.md] - 前序诊断:[2026-07-15-question-gen-v2-diagnosis-and-strategy.md]