roadmap:训练数据定为 DAPO-Math-17K(对齐论文§5.1),登记 φ/β 两处论文-代码默认值背离

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
2026-07-18 03:47:30 -04:00
parent 9c0ec15716
commit 77f0419bad
+6 -3
View File
@@ -49,6 +49,9 @@
| rollout 数 N | 10 | 10 | 每个 chunk 的 teacher MC 采样数(§4.2 证明 N=10 是甜点) | | rollout 数 N | 10 | 10 | 每个 chunk 的 teacher MC 采样数(§4.2 证明 N=10 是甜点) |
| chunk 长度 C | 50 | 50 | token 数 | | chunk 长度 C | 50 | 50 | token 数 |
| 先验强度 α | 1.0 | 1.0 | `chunk_alpha`Dirichlet 平滑 | | 先验强度 α | 1.0 | 1.0 | `chunk_alpha`Dirichlet 平滑 |
| 相似度 φ | ROUGE-1 | ROUGE-1 | 备选 edit_distance | | 相似度 φ | **edit_distance**(§5.1 | edit_distance | ⚠️ 代码默认 rouge1config L298)与论文默认背离,须显式指定 |
| Student | Qwen3-8B 级 | Qwen3-0.6B | 跑通优先 | | KL 锚权重 β | **0.1**(§5.1) | 0.1 | ⚠️ 代码默认 `mc_kl_weight=0` 与论文背离,须显式指定 |
| Teacher | Qwen3.5-397B / Claude / Gemini | DeepSeek 或 MiniMaxOpenAI 兼容) | logit-free 主路径 | | 训练数据 | DAPO-Math-17Kprompt-only | 同(层 1 先抽 ~1k 子集控制 API 成本) | 一份数据服务层 1-6;学生升到 1.7B 后可直接对表论文 Table 1 |
| Student | Qwen3-1.7B / 4B | Qwen3-0.6B | 跑通优先;升级 1.7B 即可与论文对比 |
| Teacher | Qwen3-32B / Claude-4.5-Haiku / Gemini-2.5-Flash | DeepSeek 或 MiniMaxOpenAI 兼容) | logit-free 主路径 |
| SFT 基线定义 | teacher rollout 上的离线蒸馏(非人写答案) | 同 | 对应参考实现 `_generate_teacher_completions` + JSONL 缓存路径 |