Files
ars-opd-rebuild/docs/00-roadmap.md
T

2.5 KiB
Raw Blame History

00 · 分层重构路线图

原则:按论文概念的依赖顺序逐层重建,每层完成后代码可运行、可验证。学习路径 = 提交历史。

分层计划

主题 论文对应 产出 验证方式
0 环境与骨架 本地/远程 conda 环境、gitea 同步、包骨架 两端 pytest 空跑通过
1 SFT 基线 §3.1 式(1) 数据管线 + 最小 SFT 训练脚本(Qwen3-0.6B 远程 4 卡跑通,loss 正常下降
2 White-box OPD 基线 §3.1 式(2) token 级反向 KL 蒸馏(teacher Qwen3-4B 本地 vLLM 远程跑通;理解式(2)梯度爆炸问题(§4.1)
3 相似度 + MC 估计器 §3.2.1-3.2.2 式(3)(4)(5) similarity.py + estimator.py(纯逻辑) 本地 CPU 单测,对拍 validate_mc_estimator.py
4 Peak-entropy 调度器 §3.2.3 式(6)(7) chunking.py(纯逻辑) 本地 CPU 单测:toy 熵序列上验证 chunk 选择与合并
5 完整 OmniOPD §3.2.4 式(8) teacher.pyAPI 客户端+缓存)+ trainer.pychunk 损失 + KL 锚定) 远程端到端跑通(DeepSeek/MiniMax teacher
6 评测与消融 §5 数学评测脚本;三个消融开关 MATH-500 子集上 student 有可测提升趋势

章节文档索引

文档 内容 状态
00-roadmap.md 本文
01-paper-code-map.md 论文 §3-§4 精读 + 参考实现全景解剖 + 概念↔代码对照表 写作中
02-sft-baseline.md 层 1SFT 与数据管线
03-whitebox-opd.md 层 2:token 级 KL 蒸馏及其脆弱性
04-mc-estimator.md 层 3MC 估计 + 贝叶斯平滑
05-entropy-chunking.md 层 4:熵调度
06-omniopd-full.md 层 5:完整损失与 teacher 客户端
07-eval-ablation.md 层 6:评测与消融

关键设定(与论文默认对齐,规模缩小)

参数 论文默认 本项目 说明
chunk 数 M 10 10 每条轨迹审计的 chunk 数
rollout 数 N 10 10 每个 chunk 的 teacher MC 采样数(§4.2 证明 N=10 是甜点)
chunk 长度 C 50 50 token 数
先验强度 α 1.0 1.0 chunk_alphaDirichlet 平滑
相似度 φ ROUGE-1 ROUGE-1 备选 edit_distance
Student Qwen3-8B 级 Qwen3-0.6B 跑通优先
Teacher Qwen3.5-397B / Claude / Gemini DeepSeek 或 MiniMaxOpenAI 兼容) logit-free 主路径