26 lines
2.0 KiB
YAML
26 lines
2.0 KiB
YAML
# config/video_split.yaml
|
|
# 结果驱动视频级切分 —— 科研旋钮快照(会在实验中被反复扫动 / 对比的参数)。
|
|
# 工程配置(harness.db 路径、LLM 凭证、超时)由 .env / pydantic-settings 管理,不在此文件。
|
|
# 优先级: CLI args > 此文件。CLI 仅用于单次临时覆盖。
|
|
#
|
|
# ⚠️ 下列阈值为「占位值」,必须在离线诊断跑完后用真实 T2 分布标定。
|
|
# 标定程序见 scripts/build_video_split.sh 顶部注释(诊断产物 → 逐旋钮定值)。
|
|
|
|
video_split:
|
|
baseline_run_id: infer_adhoc # 基线 run 标识(错题诊断与切分依据),对应 workspaces/default/harness.db
|
|
n_trainval: 100 # trainval 目标视频数(多样性阶段填充上限;标定取 ~100)
|
|
epsilon: 0.1 # test 相对全局最大允许分布偏差(题型占比 / 难度画像两维,逐桶)
|
|
report_floor: 27 # per-type 报告门限:题数 ≥ 此值的 task_type 才入 ε 代表性约束
|
|
val_wrong_min: 20 # validation 池最少错题数(McNemar 检验功效阈 ≈ 20,低于则信号不足)
|
|
val_ratio: 0.3 # validation 占 trainval 视频组总数的比例
|
|
seed: 7 # 贪心选择器预洗牌 + 视频组题级切分种子(打破等增益 / 等槽平局)
|
|
floor_k: # 各高信号 task_type 的 T2 defect 下限(硬约束)—— 占位,标定后替换
|
|
Counting Problem: 3 # 取克制值 min(诊断可用 defect 数, 3),避免把信号全抽进 trainval
|
|
Object Reasoning: 3
|
|
Action Reasoning: 3
|
|
|
|
diag: # 诊断口径指纹三分量(隔离不同诊断配置的信号,参与主键)
|
|
prompt_version: diagnose_v1 # 诊断 prompt 版本标识(换 prompt 即换指纹,旧记录不被覆盖)
|
|
model: deepseek-v4-pro # 执行诊断的模型名(与 .env JUDGE_LLM_MODEL 对齐)
|
|
# code_version 由 build_video_split.sh 注入 git 短 SHA,不写死在此(随代码变动)
|