diff --git a/docs/00-roadmap.md b/docs/00-roadmap.md index dc637d4..2ffd20a 100644 --- a/docs/00-roadmap.md +++ b/docs/00-roadmap.md @@ -49,6 +49,9 @@ | rollout 数 N | 10 | 10 | 每个 chunk 的 teacher MC 采样数(§4.2 证明 N=10 是甜点) | | chunk 长度 C | 50 | 50 | token 数 | | 先验强度 α | 1.0 | 1.0 | `chunk_alpha`,Dirichlet 平滑 | -| 相似度 φ | ROUGE-1 | ROUGE-1 | 备选 edit_distance | -| Student | Qwen3-8B 级 | Qwen3-0.6B | 跑通优先 | -| Teacher | Qwen3.5-397B / Claude / Gemini | DeepSeek 或 MiniMax(OpenAI 兼容) | logit-free 主路径 | +| 相似度 φ | **edit_distance**(§5.1) | edit_distance | ⚠️ 代码默认 rouge1(config L298)与论文默认背离,须显式指定 | +| KL 锚权重 β | **0.1**(§5.1) | 0.1 | ⚠️ 代码默认 `mc_kl_weight=0` 与论文背离,须显式指定 | +| 训练数据 | DAPO-Math-17K(prompt-only) | 同(层 1 先抽 ~1k 子集控制 API 成本) | 一份数据服务层 1-6;学生升到 1.7B 后可直接对表论文 Table 1 | +| Student | Qwen3-1.7B / 4B | Qwen3-0.6B | 跑通优先;升级 1.7B 即可与论文对比 | +| Teacher | Qwen3-32B / Claude-4.5-Haiku / Gemini-2.5-Flash | DeepSeek 或 MiniMax(OpenAI 兼容) | logit-free 主路径 | +| SFT 基线定义 | teacher rollout 上的离线蒸馏(非人写答案) | 同 | 对应参考实现 `_generate_teacher_completions` + JSONL 缓存路径 |