--- id: v3-frame-perception-spike-validation title: v3 §9 帧感知抽取机制 — 小样本实证验证结果 type: finding created: 2026-07-15 status: active --- # v3 §9 帧感知抽取机制:小样本实证验证 **目的**:进 writing-plans 前用真实数据验证 §9"帧感知 grounded 事实抽取 + negative_at_target + 双 VLM 交叉"能否成立(对治 Codex 三审 C3 密度 / C5 双正解,避免 v2 盲飞)。 **方法**:5 个真实视频 × 3 个 L2 段,双 VLM(qwen3.6-plus + MiniMax-M3)对真实关键帧(5 帧/段)做结构化事实抽取 + 交叉核实 + 跨段 negative_at_target 检验,94 次 VLM 调用。脚本 `scratchpad/spike_frame_perception.py`(一次性)。**Claude 亲自 Read 帧图片当第三方裁判估 shared-error。** ## 一、量化结果 | 指标 | 结果 | 对照 §9.1 假设 | |------|------|--------------| | 可抽取率 | **15/15 = 100%** | 5 帧能感知结构化绑定 ✓ | | 判别性占比 | **~83%**(跨段 negative_at_target 持续=17%,5/30) | 判别性事实是可用主体 ✓ | | negative_at_target 有效性 | **有效**:被标"其它段也成立"的 yes **全是真持续事实**(魔方演示跨段真、舞台剧跨段真、performer 站台上跨段真),且 Claude 看帧确认 | C5 双正解可被抓 ✓ | | 双 VLM 一致率(holds 判定) | **26/30 = 87%** | 交叉核实高一致 | | 粗时序(顺序)可感知性 | **可以**:两 VLM 频繁从 5 帧感知有序变化("Frame0…Frame1…"/"transitions from…to…"),Claude 看帧确认"倒立→落地"序列真实 | C3 密度:粗时序 5 帧够 ✓ | | 细粒度方式(manner) | **确认是难点**:大量 `not_determinable` + 两 VLM 各说各话 | C3/C1:fine manner 5 帧不够 ⚠ | ## 二、Claude 第三方看帧核查(shared-error) 亲自 Read GsYi 3 帧核查: - seg0 frame0:确认男表演者桌上**倒立**、smartwater 舞台、旋转木马、观众——两 VLM 粗层感知**正确且一致,无幻觉**。 - seg0 frame2:确认已**站地面**(桌空)——m3 的"倒立→落地"时序 claim **真实非幻觉**;qwen "manner 不可定"是保守。两者非"一致地错",是"保守 vs 详细"。 - seg6 frame0:确认 performer **站平台、smartwater+旋转木马背景、女助手**——negative_at_target 判该事实在 seg6 成立**正确**,正是该剔的双正解。 **结论:抽样中未见双 VLM 一致地幻觉;粗层事实、粗时序、negative_at_target 判定均锚在真实帧、经人工确认正确。** ## 三、验证结论 **§9 帧感知抽取机制在真实数据上站得住。** 两个 Codex Critical 的处置: - **C5 双正解 = 已缓解**:negative_at_target 实证有效(正确抓出跨段持续事实),剔除率 ~17% 可控,判别性主体 ~83% 可用。 - **C3 密度 = 部分确认**:粗时序/顺序 5 帧可感知(利好 temporal/cross_segment/premature);**细粒度 manner 5 帧确实不够**(只影响 fine_grained,已有密帧/fallback 设计)。 ## 四、须折进设计的实证细化 1. **fact_sampler 必须过滤到动作丰富段**:5 视频里 MYxL(幻灯片)/y2kg(录屏) 非动作视频——抽取虽成功但对 AR 无意义。fact_sampler 加"动作性"前置筛。 2. **fine_grained 密帧从"可选兜底"升为"硬前置"**:manner 5 帧不够是实证事实 → fine_grained 必须密帧重采或走 B 路线,不是运行时才发现。 3. **manner 层不能靠双 VLM 交叉核**(一致性低)→ manner 类 fact 走更严核实(更多帧+人工小样本),对齐 §9.1 C1 难度分层。 4. **多主体绑定未被本 spike 压测**(样本多为单主体)——繁忙场景的唯一绑定(Codex C4)仍是开放风险,writing-plans 或实现早期补一次多主体段实测。 5. 抽取器**倾向用详细但准确的 VLM**(m3 风格)作主抽、保守 VLM(qwen)作交叉。 ## 相关 - 设计: [2026-07-15-question-gen-v3-construction-paradigm-design.md](§9/§9.1) - 脚本/原始数据: `scratchpad/spike_frame_perception.py`、`scratchpad/spike_results.json`、遥测 `logs/spike_vlm_telemetry.db`