0fe1c96393
Complete v3 planning: construction-first paradigm (frame-perception grounded fact extraction + 4-family independent judges + 6-layer verification + QuestionUnit contract), adversarial audit, paradigm-shift finding, real-data spike validation, logging schema, and phase1 contract implementation plan.
4.1 KiB
4.1 KiB
id, title, type, created, status
| id | title | type | created | status |
|---|---|---|---|---|
| v3-frame-perception-spike-validation | v3 §9 帧感知抽取机制 — 小样本实证验证结果 | finding | 2026-07-15 | active |
v3 §9 帧感知抽取机制:小样本实证验证
目的:进 writing-plans 前用真实数据验证 §9"帧感知 grounded 事实抽取 + negative_at_target + 双 VLM 交叉"能否成立(对治 Codex 三审 C3 密度 / C5 双正解,避免 v2 盲飞)。
方法:5 个真实视频 × 3 个 L2 段,双 VLM(qwen3.6-plus + MiniMax-M3)对真实关键帧(5 帧/段)做结构化事实抽取 + 交叉核实 + 跨段 negative_at_target 检验,94 次 VLM 调用。脚本 scratchpad/spike_frame_perception.py(一次性)。Claude 亲自 Read 帧图片当第三方裁判估 shared-error。
一、量化结果
| 指标 | 结果 | 对照 §9.1 假设 |
|---|---|---|
| 可抽取率 | 15/15 = 100% | 5 帧能感知结构化绑定 ✓ |
| 判别性占比 | ~83%(跨段 negative_at_target 持续=17%,5/30) | 判别性事实是可用主体 ✓ |
| negative_at_target 有效性 | 有效:被标"其它段也成立"的 yes 全是真持续事实(魔方演示跨段真、舞台剧跨段真、performer 站台上跨段真),且 Claude 看帧确认 | C5 双正解可被抓 ✓ |
| 双 VLM 一致率(holds 判定) | 26/30 = 87% | 交叉核实高一致 |
| 粗时序(顺序)可感知性 | 可以:两 VLM 频繁从 5 帧感知有序变化("Frame0…Frame1…"/"transitions from…to…"),Claude 看帧确认"倒立→落地"序列真实 | C3 密度:粗时序 5 帧够 ✓ |
| 细粒度方式(manner) | 确认是难点:大量 not_determinable + 两 VLM 各说各话 |
C3/C1:fine manner 5 帧不够 ⚠ |
二、Claude 第三方看帧核查(shared-error)
亲自 Read GsYi 3 帧核查:
- seg0 frame0:确认男表演者桌上倒立、smartwater 舞台、旋转木马、观众——两 VLM 粗层感知正确且一致,无幻觉。
- seg0 frame2:确认已站地面(桌空)——m3 的"倒立→落地"时序 claim 真实非幻觉;qwen "manner 不可定"是保守。两者非"一致地错",是"保守 vs 详细"。
- seg6 frame0:确认 performer 站平台、smartwater+旋转木马背景、女助手——negative_at_target 判该事实在 seg6 成立正确,正是该剔的双正解。
结论:抽样中未见双 VLM 一致地幻觉;粗层事实、粗时序、negative_at_target 判定均锚在真实帧、经人工确认正确。
三、验证结论
§9 帧感知抽取机制在真实数据上站得住。 两个 Codex Critical 的处置:
- C5 双正解 = 已缓解:negative_at_target 实证有效(正确抓出跨段持续事实),剔除率 ~17% 可控,判别性主体 ~83% 可用。
- C3 密度 = 部分确认:粗时序/顺序 5 帧可感知(利好 temporal/cross_segment/premature);细粒度 manner 5 帧确实不够(只影响 fine_grained,已有密帧/fallback 设计)。
四、须折进设计的实证细化
- fact_sampler 必须过滤到动作丰富段:5 视频里 MYxL(幻灯片)/y2kg(录屏) 非动作视频——抽取虽成功但对 AR 无意义。fact_sampler 加"动作性"前置筛。
- fine_grained 密帧从"可选兜底"升为"硬前置":manner 5 帧不够是实证事实 → fine_grained 必须密帧重采或走 B 路线,不是运行时才发现。
- manner 层不能靠双 VLM 交叉核(一致性低)→ manner 类 fact 走更严核实(更多帧+人工小样本),对齐 §9.1 C1 难度分层。
- 多主体绑定未被本 spike 压测(样本多为单主体)——繁忙场景的唯一绑定(Codex C4)仍是开放风险,writing-plans 或实现早期补一次多主体段实测。
- 抽取器倾向用详细但准确的 VLM(m3 风格)作主抽、保守 VLM(qwen)作交叉。
相关
- 设计: [2026-07-15-question-gen-v3-construction-paradigm-design.md](§9/§9.1)
- 脚本/原始数据:
scratchpad/spike_frame_perception.py、scratchpad/spike_results.json、遥测logs/spike_vlm_telemetry.db