34 lines
2.3 KiB
YAML
34 lines
2.3 KiB
YAML
# config/video_split.yaml
|
|
# 结果驱动视频级切分 —— 科研旋钮快照(会在实验中被反复扫动 / 对比的参数)。
|
|
# 工程配置(harness.db 路径、LLM 凭证、超时)由 .env / pydantic-settings 管理,不在此文件。
|
|
# 优先级: CLI args > 此文件。CLI 仅用于单次临时覆盖。
|
|
#
|
|
# ⚠️ 下列阈值为「占位值」,必须在离线诊断跑完后用真实 T2 分布标定。
|
|
# 标定程序见 scripts/build_video_split.sh 顶部注释(诊断产物 → 逐旋钮定值)。
|
|
|
|
video_split:
|
|
baseline_run_id: infer_adhoc # 基线 run 标识(错题诊断与切分依据),对应 workspaces/default/harness.db
|
|
n_trainval: 100 # trainval 目标视频数(多样性阶段填充上限;标定取 ~100)
|
|
epsilon: 0.1 # test 相对全局最大允许分布偏差(题型占比 / 难度画像两维,逐桶)
|
|
report_floor: 27 # per-type 报告门限:题数 ≥ 此值的 task_type 才入 ε 代表性约束
|
|
val_wrong_min: 20 # validation 池最少错题数(McNemar 检验功效阈 ≈ 20,低于则信号不足)
|
|
val_ratio: 0.3 # validation 占 trainval 视频组总数的比例
|
|
seed: 7 # 贪心选择器预洗牌 + 视频组题级切分种子(打破等增益 / 等槽平局)
|
|
floor_k: # 各 task_type 的 T2 defect 下限(硬约束)—— 均衡覆盖全 11 类,标定于 1cb1c203 真实 T2 分布
|
|
Object Reasoning: 5 # T2=25
|
|
Information Synopsis: 5 # T2=13
|
|
Action Reasoning: 5 # T2=11
|
|
Counting Problem: 5 # T2=10
|
|
Temporal Reasoning: 2 # T2=5
|
|
Object Recognition: 2 # T2=5
|
|
Action Recognition: 2 # T2=5
|
|
Attribute Perception: 1 # T2=3
|
|
Temporal Perception: 1 # T2=2
|
|
OCR Problems: 1 # T2=2
|
|
Spatial Perception: 1 # T2=1
|
|
|
|
diag: # 诊断口径指纹三分量(隔离不同诊断配置的信号,参与主键)
|
|
prompt_version: diagnose_v1 # 诊断 prompt 版本标识(换 prompt 即换指纹,旧记录不被覆盖)
|
|
model: deepseek-v4-pro # 执行诊断的模型名(必须与 .env SEARCH_LLM_MODEL 一致,CLI 会 fail loud 校验)
|
|
# code_version 由 build_video_split.sh 注入 git 短 SHA,不写死在此(随代码变动)
|