层1/T2: 生成脚本接入本地已有的 DAPO 去重版 parquet(17917 行),补试跑说明
数据管线已用真实数据验证(加载→归一→seed 抽子集,5 条无报错) Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -19,9 +19,14 @@ from ars_opd.teacher import TeacherClient, generate_completions
|
|||||||
|
|
||||||
# 非显然约束:这里的 dataset/subset_size/seed 必须与 T5 训练脚本完全一致——
|
# 非显然约束:这里的 dataset/subset_size/seed 必须与 T5 训练脚本完全一致——
|
||||||
# 两侧各自走"加载→归一→抽子集",seed 相同才是同一批题(data.py 有详注)
|
# 两侧各自走"加载→归一→抽子集",seed 相同才是同一批题(data.py 有详注)
|
||||||
DATASET_PATH = "data/dapo-math-17k.parquet"
|
DATASET_PATH = "data/dapo-math-17k-unique.parquet" # DAPO 官方去重版,17917 行
|
||||||
CACHE_PATH = "data/teacher_completions_dapo1k_minimax-m3.jsonl"
|
CACHE_PATH = "data/teacher_completions_dapo1k_minimax-m3.jsonl"
|
||||||
|
|
||||||
|
# 试跑说明:首次建议把下面 subset_size 临时改成 5,跑通并人工抽查缓存里的解答
|
||||||
|
# 质量(think 是否剥净、格式是否正常)后再改回 1000 重跑。放心改:subset 是对
|
||||||
|
# 同一 seed 的洗牌序列取前缀,前 5 条与前 1000 条的头 5 条完全相同,试跑写入的
|
||||||
|
# 缓存在正式跑时全部命中,一分钱不浪费。
|
||||||
|
|
||||||
sft_cfg = SFTConfig(
|
sft_cfg = SFTConfig(
|
||||||
dataset_path=DATASET_PATH,
|
dataset_path=DATASET_PATH,
|
||||||
output_dir="outputs/_unused", # 本脚本不训练,仅复用数据管线配置
|
output_dir="outputs/_unused", # 本脚本不训练,仅复用数据管线配置
|
||||||
|
|||||||
Reference in New Issue
Block a user