diff --git a/docs/research-ideas.md b/docs/research-ideas.md new file mode 100644 index 0000000..a2f258b --- /dev/null +++ b/docs/research-ideas.md @@ -0,0 +1,32 @@ +# 研究方向候选记录 + +> 重构过程中冒出的研究想法登记处。每条含:动机、可证伪假设、依托本仓库的最小实验(MVP)、风险。想法不分优先级排序时按登记时间排列。 + +## RI-1 · OmniOPD × 零阶黎曼优化(ZO-RGD):全前向"双黑盒"蒸馏 + +- **来源**: 合作者论文《Zeroth-Order Riemannian Optimization on Fixed-Rank Update Manifolds for LLM Fine-Tuning》(`references/26_05_subNeruIPS_...pdf`),2026-07 登记。 +- **背景一句话**: 该文将 LoRA 式增量 ΔW 约束为固定秩流形上的点,用两次前向的有限差分(MeZO 式 ZO)+ 切空间归一化探针 + 截断 SVD retraction 做无反传微调;实验限于 OPT 分类/抽取任务。 + +### 1a. 系统组合:teacher 无 logits + 学生无反传 + +| 要素 | 说明 | +|------|------| +| 咬合点 | OmniOPD 的 π̂ 是 **detach 的常数** → ZO 的两次扰动前向 F(ΔW±εZ) 复用同一轨迹与同一组 teacher 打分,不产生额外 API 查询 | +| 协同 | ZO 步长极小 → 轨迹+打分可复用 K 个 ZO 步仍近似 on-policy → teacher API 成本摊薄 K 倍(慢优化器 × 贵监督 = 天然互补) | +| 系统故事 | 全管线跑在纯推理设施上(teacher=聊天 API,学生=vLLM 前向评分),无训练框架、无激活显存;4×A800 可碰 30B+ 学生 | +| **Gate 实验** | ZO-RGD 在本管线上先优化普通 SFT 损失(层 1 复用):长 CoT 生成任务上能否收敛到可用水平。**不过此关全案作废** | +| 风险 | ZO 在生成式/推理任务无先例(MeZO 系全是短输出分类);OmniOPD 每轨迹 10 chunk × ZO 每步 1 标量 = 双重稀疏,可能不收敛 | + +### 1b. 秩约束 = 几何 trust region,替代/减弱 β KL 锚 + +- **假设**: 式(8) 第二项(行为空间信任域)与固定秩流形约束(参数空间信任域)防的是同一失败模式(未审计区域漂移);流形约束下 β 可调小甚至归零。 +- **MVP**: 层 6 后消融网格 {全参 / LoRA / 固定秩流形} × {β=0 / β>0},测未审计 token 对 π_ref 的 KL 漂移 + 数学评测分。若"流形+β=0"≈"全参+β>0",得到干净结论。 +- **依托**: 损失/调度器即本仓库层 3-5 产出,仅换优化端;此实验**不依赖 1a 的 ZO**(一阶梯度 + retraction 即可做),风险远低于 1a,可独立先行。 + +### 1c. 方差预算分配(理论附件) + +- OmniOPD Thm 4.2(teacher 采样方差 ∝1/N)× ZO-RGD Prop 1(探针方差 ∝ mn/d_r)串联;固定预算下 N(rollout 数)与 q(探针数)的最优分配。适合作 1a 的理论章节,不独立成文。 + +### 诚实评估 + +结合发生在**管线/系统层**而非损失数学层——两文公式不冲突也不深融,叙事须立足于:① 双黑盒系统故事(1a);② 信任域替换假设(1b)。建议路径:先做 1b(便宜、独立、可证伪),1a 的 gate 实验穿插进行。