docs: add results-driven video-level split design
This commit is contained in:
@@ -0,0 +1,22 @@
|
||||
---
|
||||
type: design
|
||||
node_id: design:results-driven-video-split
|
||||
title: "结果驱动的视频级 train/val/test 切分(替代自造题模块)"
|
||||
date: 2026-07-15
|
||||
---
|
||||
|
||||
# 结果驱动的视频级 train/val/test 切分(替代自造题模块)
|
||||
|
||||
**全文设计**:[2026-07-15-results-driven-video-split-design.md](./2026-07-15-results-driven-video-split-design.md)
|
||||
|
||||
## 决策与理由
|
||||
|
||||
- **砍自造题**:14 天内造 Video-MME 同质量题风险过高;DataLoader 本就只加载+切分、不合成,故事更忠实。
|
||||
- **方案 A(内部切分)**:300 视频按**视频原子**切 ~100 train+val / 200 test,零内容泄漏。
|
||||
- **核心洞察(耦合)**:`train错题+test错题=240` 固定 → 富集 train 会注水 test;故 **test 神圣代表性冻结**,train 只靠 floor + 多样性富集(不偷 test 难题),ε 约束是耦合的算法化身。
|
||||
- **signal_score**:`DiagnosisResult` 的确定性投影,T0 INFRA / T1 lapse(混无解,接受) / T2 defect(训练主体)。
|
||||
- **多样性**:对 `(task_type × error_type)` 48 格的 submodular 最大覆盖(evolution_target 为 error_type 派生标注,非独立轴),非错题数。
|
||||
- **选择算法**:贪心联合约束 max-coverage,floor 硬约束先满足、多样性目标后最大化、不可行 fail loud。
|
||||
|
||||
## 被替代
|
||||
- 自造题 v3:[2026-07-15-question-gen-v3-construction-paradigm-design.md](./2026-07-15-question-gen-v3-construction-paradigm-design.md)
|
||||
Reference in New Issue
Block a user