Files

2.9 KiB
Raw Permalink Blame History

研究方向候选记录

重构过程中冒出的研究想法登记处。每条含:动机、可证伪假设、依托本仓库的最小实验(MVP)、风险。想法不分优先级排序时按登记时间排列。

RI-1 · OmniOPD × 零阶黎曼优化(ZO-RGD):全前向"双黑盒"蒸馏

  • 来源: 合作者论文《Zeroth-Order Riemannian Optimization on Fixed-Rank Update Manifolds for LLM Fine-Tuning》(references/26_05_subNeruIPS_...pdf),2026-07 登记。
  • 背景一句话: 该文将 LoRA 式增量 ΔW 约束为固定秩流形上的点,用两次前向的有限差分(MeZO 式 ZO)+ 切空间归一化探针 + 截断 SVD retraction 做无反传微调;实验限于 OPT 分类/抽取任务。

1a. 系统组合:teacher 无 logits + 学生无反传

要素 说明
咬合点 OmniOPD 的 π̂ 是 detach 的常数 → ZO 的两次扰动前向 F(ΔW±εZ) 复用同一轨迹与同一组 teacher 打分,不产生额外 API 查询
协同 ZO 步长极小 → 轨迹+打分可复用 K 个 ZO 步仍近似 on-policy → teacher API 成本摊薄 K 倍(慢优化器 × 贵监督 = 天然互补)
系统故事 全管线跑在纯推理设施上(teacher=聊天 API,学生=vLLM 前向评分),无训练框架、无激活显存;4×A800 可碰 30B+ 学生
Gate 实验 ZO-RGD 在本管线上先优化普通 SFT 损失(层 1 复用):长 CoT 生成任务上能否收敛到可用水平。不过此关全案作废
风险 ZO 在生成式/推理任务无先例(MeZO 系全是短输出分类);OmniOPD 每轨迹 10 chunk × ZO 每步 1 标量 = 双重稀疏,可能不收敛

1b. 秩约束 = 几何 trust region,替代/减弱 β KL 锚

  • 假设: 式(8) 第二项(行为空间信任域)与固定秩流形约束(参数空间信任域)防的是同一失败模式(未审计区域漂移);流形约束下 β 可调小甚至归零。
  • MVP: 层 6 后消融网格 {全参 / LoRA / 固定秩流形} × {β=0 / β>0},测未审计 token 对 π_ref 的 KL 漂移 + 数学评测分。若"流形+β=0"≈"全参+β>0",得到干净结论。
  • 依托: 损失/调度器即本仓库层 3-5 产出,仅换优化端;此实验不依赖 1a 的 ZO(一阶梯度 + retraction 即可做),风险远低于 1a,可独立先行。

1c. 方差预算分配(理论附件)

  • OmniOPD Thm 4.2teacher 采样方差 ∝1/N)× ZO-RGD Prop 1(探针方差 ∝ mn/d_r)串联;固定预算下 N(rollout 数)与 q(探针数)的最优分配。适合作 1a 的理论章节,不独立成文。

诚实评估

结合发生在管线/系统层而非损失数学层——两文公式不冲突也不深融,叙事须立足于:① 双黑盒系统故事(1a);② 信任域替换假设(1b)。建议路径:先做 1b(便宜、独立、可证伪),1a 的 gate 实验穿插进行。