Files
Video-Tree-TRM5/research-wiki/findings/2026-07-15-v3-frame-perception-spike-validation.md
T
iomgaa 0fe1c96393 docs: add question-gen v3 construction-paradigm design and phase1 plan
Complete v3 planning: construction-first paradigm (frame-perception grounded fact extraction + 4-family independent judges + 6-layer verification + QuestionUnit contract), adversarial audit, paradigm-shift finding, real-data spike validation, logging schema, and phase1 contract implementation plan.
2026-07-15 05:41:10 -04:00

52 lines
4.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
id: v3-frame-perception-spike-validation
title: v3 §9 帧感知抽取机制 — 小样本实证验证结果
type: finding
created: 2026-07-15
status: active
---
# v3 §9 帧感知抽取机制:小样本实证验证
**目的**:进 writing-plans 前用真实数据验证 §9"帧感知 grounded 事实抽取 + negative_at_target + 双 VLM 交叉"能否成立(对治 Codex 三审 C3 密度 / C5 双正解,避免 v2 盲飞)。
**方法**:5 个真实视频 × 3 个 L2 段,双 VLMqwen3.6-plus + MiniMax-M3)对真实关键帧(5 帧/段)做结构化事实抽取 + 交叉核实 + 跨段 negative_at_target 检验,94 次 VLM 调用。脚本 `scratchpad/spike_frame_perception.py`(一次性)。**Claude 亲自 Read 帧图片当第三方裁判估 shared-error。**
## 一、量化结果
| 指标 | 结果 | 对照 §9.1 假设 |
|------|------|--------------|
| 可抽取率 | **15/15 = 100%** | 5 帧能感知结构化绑定 ✓ |
| 判别性占比 | **~83%**(跨段 negative_at_target 持续=17%5/30 | 判别性事实是可用主体 ✓ |
| negative_at_target 有效性 | **有效**:被标"其它段也成立"的 yes **全是真持续事实**(魔方演示跨段真、舞台剧跨段真、performer 站台上跨段真),且 Claude 看帧确认 | C5 双正解可被抓 ✓ |
| 双 VLM 一致率(holds 判定) | **26/30 = 87%** | 交叉核实高一致 |
| 粗时序(顺序)可感知性 | **可以**:两 VLM 频繁从 5 帧感知有序变化("Frame0…Frame1…"/"transitions from…to…"),Claude 看帧确认"倒立→落地"序列真实 | C3 密度:粗时序 5 帧够 ✓ |
| 细粒度方式(manner) | **确认是难点**:大量 `not_determinable` + 两 VLM 各说各话 | C3/C1fine manner 5 帧不够 ⚠ |
## 二、Claude 第三方看帧核查(shared-error
亲自 Read GsYi 3 帧核查:
- seg0 frame0:确认男表演者桌上**倒立**、smartwater 舞台、旋转木马、观众——两 VLM 粗层感知**正确且一致,无幻觉**。
- seg0 frame2:确认已**站地面**(桌空)——m3 的"倒立→落地"时序 claim **真实非幻觉**qwen "manner 不可定"是保守。两者非"一致地错",是"保守 vs 详细"。
- seg6 frame0:确认 performer **站平台、smartwater+旋转木马背景、女助手**——negative_at_target 判该事实在 seg6 成立**正确**,正是该剔的双正解。
**结论:抽样中未见双 VLM 一致地幻觉;粗层事实、粗时序、negative_at_target 判定均锚在真实帧、经人工确认正确。**
## 三、验证结论
**§9 帧感知抽取机制在真实数据上站得住。** 两个 Codex Critical 的处置:
- **C5 双正解 = 已缓解**negative_at_target 实证有效(正确抓出跨段持续事实),剔除率 ~17% 可控,判别性主体 ~83% 可用。
- **C3 密度 = 部分确认**:粗时序/顺序 5 帧可感知(利好 temporal/cross_segment/premature);**细粒度 manner 5 帧确实不够**(只影响 fine_grained,已有密帧/fallback 设计)。
## 四、须折进设计的实证细化
1. **fact_sampler 必须过滤到动作丰富段**5 视频里 MYxL(幻灯片)/y2kg(录屏) 非动作视频——抽取虽成功但对 AR 无意义。fact_sampler 加"动作性"前置筛。
2. **fine_grained 密帧从"可选兜底"升为"硬前置"**:manner 5 帧不够是实证事实 → fine_grained 必须密帧重采或走 B 路线,不是运行时才发现。
3. **manner 层不能靠双 VLM 交叉核**(一致性低)→ manner 类 fact 走更严核实(更多帧+人工小样本),对齐 §9.1 C1 难度分层。
4. **多主体绑定未被本 spike 压测**(样本多为单主体)——繁忙场景的唯一绑定(Codex C4)仍是开放风险,writing-plans 或实现早期补一次多主体段实测。
5. 抽取器**倾向用详细但准确的 VLM**(m3 风格)作主抽、保守 VLM(qwen)作交叉。
## 相关
- 设计: [2026-07-15-question-gen-v3-construction-paradigm-design.md](§9/§9.1
- 脚本/原始数据: `scratchpad/spike_frame_perception.py``scratchpad/spike_results.json`、遥测 `logs/spike_vlm_telemetry.db`