diff --git a/CLAUDE.md b/CLAUDE.md index b23fcee..562c0de 100644 --- a/CLAUDE.md +++ b/CLAUDE.md @@ -40,7 +40,7 @@ conda activate ars-opd && ruff check ars_opd/ --fix && ruff format ars_opd/ > [!CRITICAL] > - 远程机 gpu-a800-060:8×A800-80G,**只允许用其中 4 块**;所有 GPU 命令必须显式 `CUDA_VISIBLE_DEVICES=`,先 `nvidia-smi` 确认空闲卡,严禁自动选卡。 > - 远程**根分区仅剩 12G**:conda 环境、HF 缓存(`HF_HOME`)、模型、checkpoint、数据集一律放 `/data/zym/` 下。 -> - 长任务用 tmux 跑,日志不缓存(`python -u` / `PYTHONUNBUFFERED=1`),确保可实时检查。 +> - **任何长时间运行的命令(训练、pip/conda 安装、脚本)禁止日志缓存**,宁可承担延时也要实时可查:python 加 `-u` / `PYTHONUNBUFFERED=1`;**不用 `conda run` 包裹长命令**(它整体缓冲输出直到结束——2026-07 曾因此把正常安装误判为卡死),改为直调 `/bin/pip`、`/bin/python`;远程长任务一律 tmux。 > - 远程机器上不改代码,只 `git pull` + 跑脚本;本地不跑训练。 ## 6. 学习工作流