docs: 修正 π̂ detach 失败机制的方向性错误(压低先验逃逸而非抬高自我强化),补充推导要点

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
2026-07-18 02:23:49 -04:00
parent d0bedd564c
commit c9eddd5be8
2 changed files with 17 additions and 2 deletions
+1 -1
View File
@@ -58,7 +58,7 @@ conda activate ars-opd && ruff check ars_opd/ --fix && ruff format ars_opd/
| 类型 | 要求 | 示例 |
|------|------|------|
| 论文锚点 | 实现论文公式/机制的函数,docstring 首行标出处;关键行旁给公式本体 | `# 式(5): π̂ = (k_sem + α·π̄) / (N + α)` |
| 非显然约束 | 只解释"为什么必须这样"及违反后果,不解释"这行在干什么"load-bearing 的反直觉点必须写 | `# π̂ 必须 detach:否则学生通过抬高自身先验自我强化,训练塌缩` |
| 非显然约束 | 只解释"为什么必须这样"及违反后果,不解释"这行在干什么"load-bearing 的反直觉点必须写 | `# π̂ 必须 detach:否则优化器会压低学生自身概率把乘子 π̂ 推向 0 以逃逸惩罚,teacher 否定的 chunk 最先塌缩` |
| 差异标注 | 凡有意偏离论文或参考实现处,注明对方做法与我们的理由 | `# 参考实现(trainer:2205)对 chunk 内取 mean,论文式(8)为 sum,此处从论文` |
**类型与 shape**