# config/video_split.yaml # 结果驱动视频级切分 —— 科研旋钮快照(会在实验中被反复扫动 / 对比的参数)。 # 工程配置(harness.db 路径、LLM 凭证、超时)由 .env / pydantic-settings 管理,不在此文件。 # 优先级: CLI args > 此文件。CLI 仅用于单次临时覆盖。 # # ⚠️ 下列阈值为「占位值」,必须在离线诊断跑完后用真实 T2 分布标定。 # 标定程序见 scripts/build_video_split.sh 顶部注释(诊断产物 → 逐旋钮定值)。 video_split: baseline_run_id: infer_adhoc # 基线 run 标识(错题诊断与切分依据),对应 workspaces/default/harness.db n_trainval: 100 # trainval 目标视频数(多样性阶段填充上限;标定取 ~100) epsilon: 0.1 # test 相对全局最大允许分布偏差(题型占比 / 难度画像两维,逐桶) report_floor: 27 # per-type 报告门限:题数 ≥ 此值的 task_type 才入 ε 代表性约束 val_wrong_min: 20 # validation 池最少错题数(McNemar 检验功效阈 ≈ 20,低于则信号不足) val_ratio: 0.4 # validation 占 trainval 视频组总数的比例(0.3→0.4 提升整包终审功效,WP2) seed: 7 # 贪心选择器预洗牌 + 视频组题级切分种子(打破等增益 / 等槽平局) floor_k: # 各 task_type 的 T2 defect 下限(硬约束)—— 均衡覆盖全 11 类,标定于 1cb1c203 真实 T2 分布 Object Reasoning: 5 # T2=25 Information Synopsis: 5 # T2=13 Action Reasoning: 5 # T2=11 Counting Problem: 5 # T2=10 Temporal Reasoning: 2 # T2=5 Object Recognition: 2 # T2=5 Action Recognition: 2 # T2=5 Attribute Perception: 1 # T2=3 Temporal Perception: 1 # T2=2 OCR Problems: 1 # T2=2 Spatial Perception: 1 # T2=1 diag: # 诊断口径指纹三分量(隔离不同诊断配置的信号,参与主键) prompt_version: diagnose_v1 # 诊断 prompt 版本标识(换 prompt 即换指纹,旧记录不被覆盖) model: deepseek-v4-pro # 执行诊断的模型名(必须与 .env SEARCH_LLM_MODEL 一致,CLI 会 fail loud 校验) # code_version 由 build_video_split.sh 注入 git 短 SHA,不写死在此(随代码变动)