b7f24d635e
对应 docs/03 §5 U5,对齐层 1 train_sft 骨架,换成层 2 装配: - 双模型:student Qwen3-0.6B(fp32+bf16混训) + teacher Qwen3-4B(bf16 推理) - prompt_only collator(无 teacher 缓存,现场 on-policy 生成) - DistillTrainer 装配:teacher_model/teacher_tokenizer + beta/温度/生成参数 - FULL = §5 默认(beta=1、lr=1e-6、B=4×GA=4×4卡=全局64、max_new_tokens=1024) - 首 prompt 自检(末尾须为生成引导符);sanity=50步冒烟 - .sh 前置清单强调白盒扛两份全词表 logits、OOM 阶梯、首跑下载 4B teacher Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>