Files
Video-Tree-TRM5/research-wiki/findings/2026-07-15-question-gen-paradigm-shift-construction-over-filtering.md
T
iomgaa 0fe1c96393 docs: add question-gen v3 construction-paradigm design and phase1 plan
Complete v3 planning: construction-first paradigm (frame-perception grounded fact extraction + 4-family independent judges + 6-layer verification + QuestionUnit contract), adversarial audit, paradigm-shift finding, real-data spike validation, logging schema, and phase1 contract implementation plan.
2026-07-15 05:41:10 -04:00

8.3 KiB
Raw Blame History

id, title, type, created, status, supersedes-frame-of
id title type created status supersedes-frame-of
question-gen-paradigm-shift-construction-over-filtering 出题范式转变 — 从"生成-打分-过滤"转向"构造优先 + 两正交独立信号"(六篇原文深读) finding 2026-07-15 active 2026-07-15-question-gen-v2-grounded-contrastive-design.md

出题范式转变:构造优先,而非生成-过滤

触发:v2 设计 + Codex 修法经两轮对抗审核后,判定撞上两堵"结构性墙"2 VLM 凑不出独立 grounding 裁判;所有门合取减产不可行区)。用户指出这是"工程补丁/表面模仿",要求回原文挖核心可行机制。遂对 6 篇论文做原文深读(非二手摘要)。

一、最关键的发现:两堵"墙"是错误框架的产物

v2 设计(含 Phase A、Codex 修法)自始至终是**"自由生成候选池 → 用裁判打分 → 过滤挑好的"。深读证明这是 AFLite 亲口认栽的死路:后置过滤的唯一信号(predictability)同时混入"真难题"和"歧义/烂题",一把尺量两样东西,拆不开——SNLI 过滤后人类精度反降 10 分**(Table 3),证明筛出的"难题"塞满连人都做不对的歧义题。

两堵墙只在这个框架里存在:

  • 墙 1(凑不出独立 grounding 裁判) 只在"事后打分 grounding"时成立。构造范式里 grounding 由"锚定真实事实的最小编辑"保证,根本不需要 grounding 裁判
  • 墙 2(合取门减产不可行区) 只在"生成垃圾再硬过滤"时成立。构造正确 by design,yield 天然高,不需要一摞过滤门相乘。

二、两种可行范式(按子模式可构造性分流)

范式 代表论文 grounding 由什么保证 wrongness/唯一正解由什么保证 适用子模式
A. 受控构造 Vinoground / TempCompass / VITATECS 对真实时序/结构事实做最小编辑 / 冲突孪生对,锚定真实事实 → 结构保证 单轴取值改变 / 孪生体互斥 → 结构保证 可锚定到结构化事件时序属性者(顺序/方向/次数/主宾/时序性位置)
B. 生成-独立筛选 GroundAttack 独立模型对真实帧的几何对齐度量(把干扰项视觉对齐度顶到正解水平,抹掉 EOB) 无保证——它的已知软肋(§5 自认未验 wrongness);须外补独立核验 构造不了者(细粒度动作方式/纯感知)

判定证据(构造 vs 过滤)

  • Vinogroundcaption 侧受控构造(GPT-4 硬约束"exact same words, only permuted"),video 侧检索+人工核验。非生成-过滤。
  • TempCompass:纯受控构造(倒放/拼接/换序造冲突孪生),无生成后过滤,质量靠人工逐条校订。
  • VITATECS:受控生成 + precision-over-recall 三级严过滤兜底(NLI + 微调判别器"正反双序一致"+ 人工改标)。
  • GroundAttack:过量生成 128 + CLIP 视觉对齐筛 4。唯一的生成-筛选范式

三、三根之前完全没有的新支柱(原文证据)

支柱 1:冲突孪生对 + 去捷径坍缩度量(TempCompass

"A 的干扰项 = B(孪生体)的正确答案"——静态帧完全相同、只翻转时序,诱导 A 答对的捷径必让 B 答错,单帧偏置+语言先验被结构性对冲归零。有效性证明不是原始准确率,而是"加入冲突后掉回随机基线的幅度"(配对准确率/一致性)——纯算法/结构验证,不需循环裁判。Table 5 铁证:Image LLM 41-49%→35-41%(逼近随机 30)。

支柱 2:难度 vs 歧义 = 两个永不合并的正交独立信号(AdVQA)

  • 难度信号 = 活求解器答错(对抗前移出题当下,骗不过就重写,5-tries 循环)。
  • 质量/歧义信号 = 独立于求解器的多裁判答案一致性10 标注者,<6 confident 且无共识→剔)。
  • 核心不变量:答案核验器必须独立于被攻求解器,用多裁判一致性证伪答案唯一性。把"作弊门"做成"求解器既当难度裁判又当答案裁判"= 退回 AFLite 单信号困境。
  • §4.5 直接证据:自动对抗无独立核验会制造答案漂移/歧义(Textfooler 错率 1.4% vs 人类闭环 38.1%)。

支柱 3:grounding 靠构造锚定真实事实(Vinoground/VITATECS/GroundAttack 共识)

"grounded"不来自"用了某模型打分",而来自:(A) 构造时锚定真实时序事实的最小编辑,或 (B) 独立模型对真实视觉证据的对齐度量。表面模仿"加个打分器"会漏掉:打分对象必须是"与真实视觉 V 的对齐度",且打分器必须独立且真的看帧;且打分器不顺带保证 wrongnessGroundAttack 软肋)

四、原文的关键警告(防止再次表面模仿)

论文 警告 对我们的意义
VITATECS Table 8 随机改 1 个名词→74.5-82.1% 可解;改词数 1→3→90.3% 可解;"cautions against purely lexical methods" 反事实必须沿正交时序轴做等信息量、非蕴含的最小编辑;名词/属性替换必退化成静态捷径可解的伪难题
VITATECS §3 纯静态感知(VISUAL/OCR/属性)没有时序轴可翻转,硬套单轴反事实会自败 不是所有 AR 子模式都适合构造范式;纯感知类需另想办法或剔除
GroundAttack §5 selector 只优化 grounding+多样性,wrongness 从未独立验证CLIP 选出的"视觉最贴合"候选恰最可能是第二正解 生成-筛选范式必须外挂独立 wrongness 核验(对齐 AdVQA
AFLite p8 过滤误删真易题 + 留下歧义题(人类精度降 10 分) 后置作弊门只能兜底,不能当主力;质量必须构造/生成端保证
TempCompass Table 5 沿用原始准确率会自欺 度量必须用配对/一致性/去捷径坍缩,而非单题准确率

五、对 6 个 AR 子模式的范式分流(初判,待 brainstorming 细化)

子模式 范式 构造手段 备注
temporal_reasoning_failure A 构造 树事件序列换序 → 冲突孪生对 + 双向 AND 最佳适配(Vinoground/TempCompass Event-Order
cross_segment_entity_tracking A 构造 主宾互换 / first-last 翻转,保词袋 Compositionality 最小编辑
fine_grained_visual_action B 生成-筛选 qwen 过量生成 + MiniMax 看帧筛视觉对齐 + 独立 wrongness 核验 构造不了动作方式;2-VLM 独立性问题局限在此一个子模式
premature_evidence_anchoring A 构造(改造) 段位随机 + 跨段唯一性;本质是"时序性锚点"单轴 需确保锚定时序而非静态
evidence_gap_confabulation 待定 二元(诚实 vs 虚构因果链),非静态感知 可能需独立设计;不套单轴反事实
semantic_rigidity 待定/可能剔除 唯一同义改写 vs 字幕陷阱——偏静态语义 VITATECS 警告静态类不适合;重新评估是否保留

六、范式转变对 v2 设计的意义

现 v2 设计(2026-07-15-question-gen-v2-grounded-contrastive-design.md)的整个框架(生成-打分-过滤 + 事后 grounding 裁判 + 一摞合取门)被本 finding 取代。 新框架:

  1. 构造优先:能锚定到树的结构化事实的子模式,走"最小编辑 + 冲突孪生对"grounding/wrongness/唯一性由构造保证,绕开两堵墙。
  2. 生成-独立筛选仅用于构造不了的子模式fine_grained),且必须解耦 grounding(看帧对齐)与 wrongness(独立核验)两道关卡。
  3. 难度/歧义两正交独立信号:难度=活求解器 Agent 答错(对抗前移,复用现有 AgentLoop);歧义=独立于求解器的多裁判/构造式答案唯一性核验。
  4. 度量革命:验收用配对准确率/去捷径坍缩(text-only 盲答、单帧基线掉回随机),纯算法,非循环裁判。
  5. LLM 角色收缩:从"自由发明干扰项"变为"对结构化树事实做受控最小编辑的表面实现 + 结构化属性抽取"。

相关

  • 论文原文:reference/papers-distractor-gen/6 篇深读证据页码见各专读报告)
  • 被取代框架:[2026-07-15-question-gen-v2-grounded-contrastive-design.md]
  • 前序审核:[2026-07-15-question-gen-v2-adversarial-audit.md]
  • 前序诊断:[2026-07-15-question-gen-v2-diagnosis-and-strategy.md]