23 lines
1.4 KiB
Markdown
23 lines
1.4 KiB
Markdown
---
|
||
type: design
|
||
node_id: design:results-driven-video-split
|
||
title: "结果驱动的视频级 train/val/test 切分(替代自造题模块)"
|
||
date: 2026-07-15
|
||
---
|
||
|
||
# 结果驱动的视频级 train/val/test 切分(替代自造题模块)
|
||
|
||
**全文设计**:[2026-07-15-results-driven-video-split-design.md](./2026-07-15-results-driven-video-split-design.md)
|
||
|
||
## 决策与理由
|
||
|
||
- **砍自造题**:14 天内造 Video-MME 同质量题风险过高;DataLoader 本就只加载+切分、不合成,故事更忠实。
|
||
- **方案 A(内部切分)**:300 视频按**视频原子**切 ~100 train+val / 200 test,零内容泄漏。
|
||
- **核心洞察(耦合)**:`train错题+test错题=240` 固定 → 富集 train 会注水 test;故 **test 神圣代表性冻结**,train 只靠 floor + 多样性富集(不偷 test 难题),ε 约束是耦合的算法化身。
|
||
- **signal_score**:`DiagnosisResult` 的确定性投影,T0 INFRA / T1 lapse(混无解,接受) / T2 defect(训练主体)。
|
||
- **多样性**:对 `(task_type × error_type)` 48 格的 submodular 最大覆盖(evolution_target 为 error_type 派生标注,非独立轴),非错题数。
|
||
- **选择算法**:贪心联合约束 max-coverage,floor 硬约束先满足、多样性目标后最大化、不可行 fail loud。
|
||
|
||
## 被替代
|
||
- 自造题 v3:[2026-07-15-question-gen-v3-construction-paradigm-design.md](./2026-07-15-question-gen-v3-construction-paradigm-design.md)
|