cccccc0ce6
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
33 lines
2.9 KiB
Markdown
33 lines
2.9 KiB
Markdown
# 研究方向候选记录
|
||
|
||
> 重构过程中冒出的研究想法登记处。每条含:动机、可证伪假设、依托本仓库的最小实验(MVP)、风险。想法不分优先级排序时按登记时间排列。
|
||
|
||
## RI-1 · OmniOPD × 零阶黎曼优化(ZO-RGD):全前向"双黑盒"蒸馏
|
||
|
||
- **来源**: 合作者论文《Zeroth-Order Riemannian Optimization on Fixed-Rank Update Manifolds for LLM Fine-Tuning》(`references/26_05_subNeruIPS_...pdf`),2026-07 登记。
|
||
- **背景一句话**: 该文将 LoRA 式增量 ΔW 约束为固定秩流形上的点,用两次前向的有限差分(MeZO 式 ZO)+ 切空间归一化探针 + 截断 SVD retraction 做无反传微调;实验限于 OPT 分类/抽取任务。
|
||
|
||
### 1a. 系统组合:teacher 无 logits + 学生无反传
|
||
|
||
| 要素 | 说明 |
|
||
|------|------|
|
||
| 咬合点 | OmniOPD 的 π̂ 是 **detach 的常数** → ZO 的两次扰动前向 F(ΔW±εZ) 复用同一轨迹与同一组 teacher 打分,不产生额外 API 查询 |
|
||
| 协同 | ZO 步长极小 → 轨迹+打分可复用 K 个 ZO 步仍近似 on-policy → teacher API 成本摊薄 K 倍(慢优化器 × 贵监督 = 天然互补) |
|
||
| 系统故事 | 全管线跑在纯推理设施上(teacher=聊天 API,学生=vLLM 前向评分),无训练框架、无激活显存;4×A800 可碰 30B+ 学生 |
|
||
| **Gate 实验** | ZO-RGD 在本管线上先优化普通 SFT 损失(层 1 复用):长 CoT 生成任务上能否收敛到可用水平。**不过此关全案作废** |
|
||
| 风险 | ZO 在生成式/推理任务无先例(MeZO 系全是短输出分类);OmniOPD 每轨迹 10 chunk × ZO 每步 1 标量 = 双重稀疏,可能不收敛 |
|
||
|
||
### 1b. 秩约束 = 几何 trust region,替代/减弱 β KL 锚
|
||
|
||
- **假设**: 式(8) 第二项(行为空间信任域)与固定秩流形约束(参数空间信任域)防的是同一失败模式(未审计区域漂移);流形约束下 β 可调小甚至归零。
|
||
- **MVP**: 层 6 后消融网格 {全参 / LoRA / 固定秩流形} × {β=0 / β>0},测未审计 token 对 π_ref 的 KL 漂移 + 数学评测分。若"流形+β=0"≈"全参+β>0",得到干净结论。
|
||
- **依托**: 损失/调度器即本仓库层 3-5 产出,仅换优化端;此实验**不依赖 1a 的 ZO**(一阶梯度 + retraction 即可做),风险远低于 1a,可独立先行。
|
||
|
||
### 1c. 方差预算分配(理论附件)
|
||
|
||
- OmniOPD Thm 4.2(teacher 采样方差 ∝1/N)× ZO-RGD Prop 1(探针方差 ∝ mn/d_r)串联;固定预算下 N(rollout 数)与 q(探针数)的最优分配。适合作 1a 的理论章节,不独立成文。
|
||
|
||
### 诚实评估
|
||
|
||
结合发生在**管线/系统层**而非损失数学层——两文公式不冲突也不深融,叙事须立足于:① 双黑盒系统故事(1a);② 信任域替换假设(1b)。建议路径:先做 1b(便宜、独立、可证伪),1a 的 gate 实验穿插进行。
|