ee16e29846
根因(探针定案):预训练模型真实 CE≈0.85,训练日志 7.5≈0.94×8(累积步数)。 Qwen3 forward 接受 loss_kwargs → Trainer 走新式契约不再除以累积步数,我们 返回裸 mean 导致日志与梯度同放大 8 倍。sft_loss 纯函数不动,适配收口在 compute_loss;docs/02 §5 勘误起点预期(~0.85)并记录此坑。 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>