roadmap:训练数据定为 DAPO-Math-17K(对齐论文§5.1),登记 φ/β 两处论文-代码默认值背离
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
+6
-3
@@ -49,6 +49,9 @@
|
||||
| rollout 数 N | 10 | 10 | 每个 chunk 的 teacher MC 采样数(§4.2 证明 N=10 是甜点) |
|
||||
| chunk 长度 C | 50 | 50 | token 数 |
|
||||
| 先验强度 α | 1.0 | 1.0 | `chunk_alpha`,Dirichlet 平滑 |
|
||||
| 相似度 φ | ROUGE-1 | ROUGE-1 | 备选 edit_distance |
|
||||
| Student | Qwen3-8B 级 | Qwen3-0.6B | 跑通优先 |
|
||||
| Teacher | Qwen3.5-397B / Claude / Gemini | DeepSeek 或 MiniMax(OpenAI 兼容) | logit-free 主路径 |
|
||||
| 相似度 φ | **edit_distance**(§5.1) | edit_distance | ⚠️ 代码默认 rouge1(config L298)与论文默认背离,须显式指定 |
|
||||
| KL 锚权重 β | **0.1**(§5.1) | 0.1 | ⚠️ 代码默认 `mc_kl_weight=0` 与论文背离,须显式指定 |
|
||||
| 训练数据 | DAPO-Math-17K(prompt-only) | 同(层 1 先抽 ~1k 子集控制 API 成本) | 一份数据服务层 1-6;学生升到 1.7B 后可直接对表论文 Table 1 |
|
||||
| Student | Qwen3-1.7B / 4B | Qwen3-0.6B | 跑通优先;升级 1.7B 即可与论文对比 |
|
||||
| Teacher | Qwen3-32B / Claude-4.5-Haiku / Gemini-2.5-Flash | DeepSeek 或 MiniMax(OpenAI 兼容) | logit-free 主路径 |
|
||||
| SFT 基线定义 | teacher rollout 上的离线蒸馏(非人写答案) | 同 | 对应参考实现 `_generate_teacher_completions` + JSONL 缓存路径 |
|
||||
|
||||
Reference in New Issue
Block a user