Files
Video-Tree-TRM5/research-wiki/findings/2026-07-15-v3-frame-perception-spike-validation.md
T
iomgaa 0fe1c96393 docs: add question-gen v3 construction-paradigm design and phase1 plan
Complete v3 planning: construction-first paradigm (frame-perception grounded fact extraction + 4-family independent judges + 6-layer verification + QuestionUnit contract), adversarial audit, paradigm-shift finding, real-data spike validation, logging schema, and phase1 contract implementation plan.
2026-07-15 05:41:10 -04:00

4.1 KiB
Raw Blame History

id, title, type, created, status
id title type created status
v3-frame-perception-spike-validation v3 §9 帧感知抽取机制 — 小样本实证验证结果 finding 2026-07-15 active

v3 §9 帧感知抽取机制:小样本实证验证

目的:进 writing-plans 前用真实数据验证 §9"帧感知 grounded 事实抽取 + negative_at_target + 双 VLM 交叉"能否成立(对治 Codex 三审 C3 密度 / C5 双正解,避免 v2 盲飞)。

方法:5 个真实视频 × 3 个 L2 段,双 VLMqwen3.6-plus + MiniMax-M3)对真实关键帧(5 帧/段)做结构化事实抽取 + 交叉核实 + 跨段 negative_at_target 检验,94 次 VLM 调用。脚本 scratchpad/spike_frame_perception.py(一次性)。Claude 亲自 Read 帧图片当第三方裁判估 shared-error。

一、量化结果

指标 结果 对照 §9.1 假设
可抽取率 15/15 = 100% 5 帧能感知结构化绑定 ✓
判别性占比 ~83%(跨段 negative_at_target 持续=17%5/30 判别性事实是可用主体 ✓
negative_at_target 有效性 有效:被标"其它段也成立"的 yes 全是真持续事实(魔方演示跨段真、舞台剧跨段真、performer 站台上跨段真),且 Claude 看帧确认 C5 双正解可被抓 ✓
双 VLM 一致率(holds 判定) 26/30 = 87% 交叉核实高一致
粗时序(顺序)可感知性 可以:两 VLM 频繁从 5 帧感知有序变化("Frame0…Frame1…"/"transitions from…to…"),Claude 看帧确认"倒立→落地"序列真实 C3 密度:粗时序 5 帧够 ✓
细粒度方式(manner) 确认是难点:大量 not_determinable + 两 VLM 各说各话 C3/C1fine manner 5 帧不够 ⚠

二、Claude 第三方看帧核查(shared-error

亲自 Read GsYi 3 帧核查:

  • seg0 frame0:确认男表演者桌上倒立、smartwater 舞台、旋转木马、观众——两 VLM 粗层感知正确且一致,无幻觉
  • seg0 frame2:确认已站地面(桌空)——m3 的"倒立→落地"时序 claim 真实非幻觉qwen "manner 不可定"是保守。两者非"一致地错",是"保守 vs 详细"。
  • seg6 frame0:确认 performer 站平台、smartwater+旋转木马背景、女助手——negative_at_target 判该事实在 seg6 成立正确,正是该剔的双正解。

结论:抽样中未见双 VLM 一致地幻觉;粗层事实、粗时序、negative_at_target 判定均锚在真实帧、经人工确认正确。

三、验证结论

§9 帧感知抽取机制在真实数据上站得住。 两个 Codex Critical 的处置:

  • C5 双正解 = 已缓解negative_at_target 实证有效(正确抓出跨段持续事实),剔除率 ~17% 可控,判别性主体 ~83% 可用。
  • C3 密度 = 部分确认:粗时序/顺序 5 帧可感知(利好 temporal/cross_segment/premature);细粒度 manner 5 帧确实不够(只影响 fine_grained,已有密帧/fallback 设计)。

四、须折进设计的实证细化

  1. fact_sampler 必须过滤到动作丰富段5 视频里 MYxL(幻灯片)/y2kg(录屏) 非动作视频——抽取虽成功但对 AR 无意义。fact_sampler 加"动作性"前置筛。
  2. fine_grained 密帧从"可选兜底"升为"硬前置":manner 5 帧不够是实证事实 → fine_grained 必须密帧重采或走 B 路线,不是运行时才发现。
  3. manner 层不能靠双 VLM 交叉核(一致性低)→ manner 类 fact 走更严核实(更多帧+人工小样本),对齐 §9.1 C1 难度分层。
  4. 多主体绑定未被本 spike 压测(样本多为单主体)——繁忙场景的唯一绑定(Codex C4)仍是开放风险,writing-plans 或实现早期补一次多主体段实测。
  5. 抽取器倾向用详细但准确的 VLM(m3 风格)作主抽、保守 VLM(qwen)作交叉。

相关

  • 设计: [2026-07-15-question-gen-v3-construction-paradigm-design.md](§9/§9.1
  • 脚本/原始数据: scratchpad/spike_frame_perception.pyscratchpad/spike_results.json、遥测 logs/spike_vlm_telemetry.db