ML/AI 每日深度论文追踪 · 周一 · LLM / NLP
当 SFT 时代的 PEFT 工具箱撞上强化学习的 KL 约束——一次关于“该动哪些参数”的重新提问
一句话定位:GeoRA 把参数高效适配的“适配对象”从预训练权重矩阵 W 本身,换成了一个先经几何筛选、再做 SVD 的代理矩阵 WGeo——它不再问“哪个子空间表达力最强”(SFT 视角),而是问“哪个子空间被扰动的代价最低”(RL 视角)。
| 项目 | 说明 |
|---|---|
| 领域轮转 | 周一(date +%u = 1)→ LLM / NLP:推理与 test-time scaling、post-training、评测基准 |
| 候选池 | 24 篇(ACL 2026 Main Best/Outstanding/Resource/Theme 11 篇 + ACL 2026 Findings 2 篇 + ICLR 2026 与近 8 个月 arXiv 11 篇) |
| 抽取方式 | shuf -i 1-24 -n 5 取首位 → #3 = GeoRA;重抽 0 次 |
| 去重索引 | ⚠️ 未能访问。本次为云端计划任务运行,桌面端未连接,ml-report-index.md 不可达,14 天去重无法自动校验 |
| 材料来源 | arXiv HTML 全文(v3 / v4)+ ACL Anthology 元数据页;未获取 PDF 原始排版 |
| 已知不完备之处 | ① 图 3–7 为曲线图,只能引用文字描述;② 表 8(1.5B/4B)抽取仅得 GeoRA 行,故不作横向比较;③ 论文未公开代码,实现细节无法交叉验证 |
以下链接均在本次运行中通过实际访问确认可达;未确认者明确标注。
| 论文 | 会议 / Anthology | arXiv | Code | 备注 |
|---|---|---|---|---|
| 核心:GeoRA | ACL 2026 Long #1110 pp. 24207–24221 |
arXiv:2601.09361 v1 2026-01-14 / v4 2026-07-31 |
未公开 | Outstanding Paper |
| LoRA | ICLR 2022 | arXiv:2106.09685 | microsoft/LoRA | abs 页 WebFetch 被 provenance 拦截 |
| PiSSA | NeurIPS 2024 Spotlight | arXiv:2404.02948 | GraphPKU/PiSSA | 全文已读 |
| MiLoRA | NAACL 2025 Long #248 | arXiv:2406.09044 | sufenlp/MiLoRA | Anthology 页已读 |
| RL Finetunes Small Subnetworks | 未找到 venue 页 | arXiv:2505.11711 | 未找到 | 摘要与关键数字已读 |
| DeepSeekMath / GRPO | 技术报告 | arXiv:2402.03300 | deepseek-ai/DeepSeek-Math | GeoRA 的 RL 优化器来源 |
| LoRA-RLPO / RLMO | 未找到 | arXiv:2606.31813 | 未找到 | abs 页返回空文本,内容经第三方综述交叉确认 |
arxiv.org/abs/2106.09685、arxiv.org/abs/2406.09044、huggingface.co/papers 三处触发了抓取代理的 provenance / 限流拦截。它们的 URL 形态由搜索引擎结果确认有效,但本报告没有对这三页做正文级验证。
论文指向的不是“LoRA 效果不好”这种泛泛之谈。PiSSA 的设计逻辑是把 W 的主奇异分量交给适配器训练——这在 SFT 下有效(PiSSA 原文:Mistral-7B GSM8K 从 LoRA 的 67.7% 提到 72.86%,+5.16pp)。但在 RLVR 下,主奇异方向承载的正是模型已经学好的通用能力。
GeoRA 表 1(Qwen3-8B,数学 RLVR 训练后在训练域之外评测)给出了这个代价的直接量化:
| OOD 基准 | Base | PiSSA | 变化 | 折算题数 |
|---|---|---|---|---|
| HumanEval | 76.83 | 71.95 | −4.88pp | −8 / 164 题 |
| IFEval | 54.32 | 48.74 | −5.58pp | — |
| TruthfulQA | 68.91 | 65.95 | −2.96pp | — |
| GPQA | 36.91 | 36.16 | −0.75pp | — |
| MMLU | 71.94 | 73.89 | +1.95pp | — |
HumanEval 题数折算依据:76.83% × 164 = 126 题,71.95% × 164 = 118 题,二者均落在 1/164 = 0.61pp 的整数网格上,说明该列数值内部自洽。
| 方法 | Llama NSS↓ | Llama SH↓ | Llama ST↑ | Qwen NSS↓ | Qwen SH↓ | Qwen ST↑ |
|---|---|---|---|---|---|---|
| PiSSA | 0.395 | 0.98 | 0.01 | 0.418 | 0.95 | 0.03 |
| LoRA | 0.214 | 0.15 | 0.15 | 0.235 | 0.18 | 0.18 |
| MiLoRA | 0.125 | 0.12 | 0.92 | 0.132 | 0.16 | 0.90 |
| GeoRA | 0.092 | 0.005 | 0.98 | 0.096 | 0.015 | 0.96 |
PiSSA 的 NSS 是 GeoRA 的 4.3×(0.395/0.092)与 4.4×(0.418/0.096);SH 相差 两个数量级。三行数字把 “SH 高 → NSS 高 → OOD 掉点” 串成一条可检验的链条:PiSSA(0.95, 0.418, −2.44) → MiLoRA(0.16, 0.132, +0.17) → GeoRA(0.015, 0.096, +2.10),三点单调、方向一致。
⚠️ 但见批判 C4:SH 低对 GeoRA 而言几乎是构造性保证,而非实验发现。
论文的论证不是“我们提出了 X,实验显示 X 好”,而是一条五步递进的链条,每一步都在回应上一步留下的反驳:
| 牺牲了什么 | 换来了什么 | 证据 |
|---|---|---|
| 适配容量的表达力上界(只能在低曲率 / 近零权重区域调整) | KL 可控性 + OOD 保持 | 表 1:GeoRA OOD 平均 +2.10pp,FullFT −1.43pp |
| 一次性 SVD + 双掩码预处理成本 | 训练全程 −19.9% 单步耗时 | 表 3 + 表 7 |
| 主奇异方向的“快速收敛红利”(PiSSA 的核心卖点) | 训练稳定性 | 图 4/5:PiSSA、MiLoRA 在高学习率下迅速退化 |
第三行的权衡在数字上其实没有真的被牺牲:GeoRA 在数学 ID 上仍是全表最高(34.04 vs PiSSA 32.27),说明“低曲率区域容量不足”这个担忧在 r=16 的预算下尚未成为瓶颈。这是论文比较幸运的一点,也是它的脆弱点(见批判 C6)。
| 机制 / 维度 | 设计选择 | 动机 | 关键超参 |
|---|---|---|---|
| 参数选择先验 | Spectral ∪ Euclidean 双掩码 | 稀疏 ≠ 低秩,需几何信息引导 | ρ = 0.2 |
| 适配器初始化 | 对 WGeo 做截断 SVD,Σ1/2 对称分摊 | 让适配器落在低曲率子空间 | r = 16, α = 32 |
| 稳定性锚 | 冻结残差 Wres | 限制学习流形,控制 KL | — |
| RL 目标 | GRPO | 组相对优势,无需 value 网络 | KL 系数 0.001,rollout = 8 |
| 初始化加速 | Randomized SVD | 把预处理压到训练时间的 0.025% | — |
| 分组 | MSpec | MEuc | 交集 | Jaccard | 并集覆盖率(本报告推算) |
|---|---|---|---|---|---|
| MLP | 20.0% | 20.0% | 4.63% | 0.131 | 35.37% |
| Attn | 20.0% | 20.0% | 4.25% | 0.119 | 35.75% |
| All | 20.0% | 20.0% | 4.55% | 0.128 | 35.45% |
| 参数 | 取值 | 扫描范围 |
|---|---|---|
| rank r | 16 | {4, 8, 16, 32} |
| scaling α | 32 | — |
| 稀疏比 ρ | 0.2 | {10%, 20%, 30%, 40%} |
| 学习率 | 1×10⁻⁶ | 压力测试至 5×10⁻⁵(50×) |
| 全局 batch / rollout / KL 系数 | 128 / 8 / 0.001 | — |
| 硬件 | 80GB GPU;数学·医学 1×8 卡,代码 2×8 卡 | — |
| 随机种子 | 单次运行(single random run),不报告标准差 | |
| 模型 | 操作 | 墙钟时间 | 峰值显存 |
|---|---|---|---|
| 8B | 完整训练 | 838 min | ~384 GB |
| 8B | 标准 SVD | 18.87 min | 16.48 GB |
| 8B | Randomized SVD | 0.21 min | 15.78 GB |
| 32B | Randomized SVD | 0.26 min | 28.43 GB |
| 72B | Randomized SVD | 0.72 min | 140.41 GB |
加速比 18.87 / 0.21 = 89.9×(论文表述为“约 100×”,略有夸大但同量级)。相对训练总时长:0.21 / 838 = 0.025%,即初始化开销可忽略。
| 方法 | AIME24 | AIME25 | MATH500 | OlymMATH | ID 均值 | HumanEval | GPQA | MMLU | IFEval | TruthfulQA | OOD 均值 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Base | 13.33 | 11.67 | 71.20 | 9.75 | 26.49 | 76.83 | 36.91 | 71.94 | 54.32 | 68.91 | 61.78 |
| FullFT | 23.33 | 22.08 | 78.40 | 11.25 | 33.77 | 76.83† | 36.91† | 71.94† | 50.45 | 65.65 | 60.36 |
| SparseFT | 22.92 | 21.25 | 76.80 | 11.50 | 33.12 | 79.50 | 37.20 | 74.20 | 50.95 | 66.05 | 61.58 |
| LoRA | 19.58 | 19.58 | 75.60 | 10.75 | 31.38 | 81.10 | 37.50 | 75.65 | 52.13 | 66.82 | 62.64 |
| PiSSA | 22.50 | 20.42 | 74.40 | 11.75 | 32.27 | 71.95 | 36.16 | 73.89 | 48.74 | 65.95 | 59.34 |
| MiLoRA | 20.42 | 19.58 | 76.20 | 11.50 | 31.93 | 78.66 | 38.26 | 74.51 | 51.85 | 66.46 | 61.95 |
| GeoRA | 23.75 | 21.67 | 78.00 | 12.75 | 34.04 | 82.93 | 37.92 | 75.96 | 53.73 | 68.85 | 63.88 |
† 该三列 FullFT 数值与 Base 完全相同(76.83 / 36.91 / 71.94)——已通过二次定向抓取确认。详见批判 C1。ID / OOD 均值由本报告依表内数值计算。
图 A · 相对 Base 的双轴增益分解(Qwen3-8B,单位 pp)
数据来源:GeoRA 表 1;ID = 4 个数学基准均值,OOD = 5 个域外基准均值。均值与差值由本报告计算。悬停查看数值。
| 方法 | ID 均值 | OOD 均值 | ΔID | ΔOOD |
|---|---|---|---|---|
| Base | 16.48 | 61.49 | — | — |
| FullFT | 24.37 | 60.01 | +7.89 | −1.48 |
| SparseFT | 23.94 | 61.07 | +7.46 | −0.42 |
| LoRA | 21.66 | 62.28 | +5.18 | +0.79 |
| PiSSA | 23.42 | 60.63 | +6.94 | −0.86 |
| MiLoRA | 22.42 | 62.10 | +5.94 | +0.61 |
| GeoRA | 24.51 | 62.95 | +8.03 | +1.46 |
结论方向一致,但幅度显著收窄:GeoRA 的 ΔOOD 领先第二名(MiLoRA)从 Qwen 上的 +1.24pp 缩到 +0.85pp。见批判 C7。
| 方法 | MedQA | MedMCQA | PubMedQA | 医学均值 | LiveCodeBench | HumanEval | MBPP | 代码均值 |
|---|---|---|---|---|---|---|---|---|
| Base | 58.03 | 56.42 | 74.94 | 63.13 | 65.75 | 87.66 | 79.40 | 77.60 |
| FullFT | 75.32 | 64.56 | 80.12 | 73.33 | 67.75 | 90.26 | 81.40 | 79.80 |
| LoRA | 74.23 | 62.12 | 79.54 | 71.96 | 67.25 | 88.96 | 81.00 | 79.07 |
| GeoRA | 76.12 | 64.31 | 80.64 | 73.69 | 67.75 | 89.61 | 81.60 | 79.65 |
| 配置 | Reward | AIME24 | AIME25 | MATH-500 | OlymMATH | 均值 | Δ 均值 |
|---|---|---|---|---|---|---|---|
| GeoRA(完整) | 0.88 | 13.33 | 9.17 | 73.40 | 5.75 | 25.41 | — |
| w/o MSpec | 0.86 | 12.50 | 8.33 | 72.00 | 4.75 | 24.40 | −1.01 |
| w/o MEuc | 0.83 | 13.33 | 8.75 | 72.80 | 5.50 | 25.10 | −0.31 |
w/o M_Spec:reward 0.86(更高) → 均值 24.40(更低)w/o M_Euc:reward 0.83(更低) → 均值 25.10(更高)同时,w/o M_Euc 只掉 0.31pp,而论文用它论证“移除任一掩码都会一致地降低性能”。0.31pp 在 4 基准平均、单次运行、且包含 AIME(30 题量级)的设置下,难以与噪声区分。
| 扫描维度 | 范围 | 论文报告形式 | 本报告评估 |
|---|---|---|---|
| rank r | {4, 8, 16, 32} | 图 7(a) reward 轨迹 | ⚠️ 只有 reward,无下游准确率;结合 §5.4 反序,证据不充分 |
| 稀疏比 ρ | {10%, 20%, 30%, 40%} | 图 7(b) reward 轨迹 | ⚠️ 同上 |
| 学习率 | 1×10⁻⁶ → 5×10⁻⁵(50×) | 图 4 / 图 5(含 KL 轨迹) | ✅ 最有价值的敏感性证据:对应明确的失败模式(训练崩溃),不依赖 reward–accuracy 相关性 |
论文未报告任何明确的相变或突变点。ρ 从 10% 到 40% 意味着并集覆盖率约从 19% 到 66%(3.5 倍跨度),若性能真的“极强鲁棒”,反而暗示双掩码的具体阈值不是关键变量——这与论文强调“几何先验精确选择”的叙事存在张力(C8)。
论文明确说明结果“基于单次随机运行”,不报告标准差、置信区间或多种子重复。
| # | 论文原文(英译中) | 严重度 |
|---|---|---|
| L1 | “初始化过程需要执行截断 SVD 和双掩码操作。虽然这是训练开始时的一次性计算成本,但相比标准 LoRA 的随机初始化引入了额外的预处理步骤。” | 低 —— 表 7 自证仅占训练时间 0.025% |
| L2 | “我们的实验主要聚焦于推理域的 RLVR。尽管 GeoRA 在这些任务上表现强劲,其泛化性仍需在更广泛的模型架构和 verifiable rewards 之外的多样 RL 场景中进一步验证。” | 中 —— 承认范围限制,但未承认下列任何一条 |
Qwen3-8B 上 FullFT 与 Base 在 HumanEval(76.83)、GPQA(36.91)、MMLU(71.94)三列逐位相同;Llama-3.1-8B 上同样三列同样相同(65.20 / 31.15 / 68.40)。而 IFEval 与 TruthfulQA 两列则不同。三个数字在两个不同模型上同时精确复现的概率可忽略,因此只有两种解释:(a) 复制粘贴错误,(b) 这三个基准未对 FullFT 重新评测。
剔除这三列后,唯一可信的 OOD 对比只剩 IFEval 和 TruthfulQA。重算如下:
| 方法 | Qwen3-8B(IFEval+TruthfulQA 平均 Δ) | Llama-3.1-8B |
|---|---|---|
| FullFT | −3.57 | −3.69 |
| SparseFT | −3.12 | −2.95 |
| PiSSA | −4.27 | −4.02 |
| LoRA | −2.14 | −1.51 |
| MiLoRA | −2.46 | −1.46 |
| GeoRA | −0.33 | −1.19 |
结论:论文的核心主张在剔除可疑数据后依然成立(GeoRA 退化最小),但 Qwen 上的领先从“OOD 净增益 +2.10pp”降级为“退化最小,−0.33pp”,“提升 OOD”的措辞不再有依据。而 Llama 上 GeoRA(−1.19)与 MiLoRA(−1.46)、LoRA(−1.51)的差距只有 0.27–0.32pp,已进入噪声量级。
图 B · 剔除可疑数据后的 OOD 退化(仅 IFEval + TruthfulQA 两列,单位 pp)
C1 的重算结果。数值越接近 0 越好。两条序列是两个模型族,单位相同,故共用一个纵轴。悬停查看数值。
表 2 的基线集合是 {Base, FullFT, LoRA},PiSSA、MiLoRA、SparseFT 全部缺席。这不是无关紧要的省略:全文的靶子就是“PiSSA 类主分量初始化在 RLVR 下有害”。如果这个论断是方法层面的(而非数学任务特有的),它在医学和代码上也应该成立并被验证。保守推断:GeoRA 优于 SVD-based 初始化这一核心论断,目前只有数学域的证据。
论文的 AIME 评测是 30 题 × 8 rollout = 240 个样本,网格步长 1/240 = 0.4167pp。核对数值:
| 数值 | 折算 | 验证 |
|---|---|---|
| GeoRA AIME24 = 23.75 | 57 / 240 | 57/240 = 23.750% ✓ |
| FullFT AIME24 = 23.33 | 56 / 240 | 56/240 = 23.333% ✓ |
| GeoRA AIME25 = 21.67 | 52 / 240 | 52/240 = 21.667% ✓ |
| FullFT AIME25 = 22.08 | 53 / 240 | 53/240 = 22.083% ✓ |
SH 衡量适配器子空间与头部奇异子空间的对齐度。GeoRA 的构造过程显式地把高幅值条目掩掉了,因此 SH ≈ 0.005–0.015 几乎是设计的直接推论,而非需要实验才能知道的经验发现。同理 PiSSA 的 0.95–0.98 也由其定义决定。表 6 因此更接近“设计意图的自我确认”,而非“机制的因果证据”。真正能构成因果链的做法是:构造一族 SH 连续变化的初始化方案,观察 OOD 退化是否随之单调——论文没有做。(NSS 受此影响较轻,因为它测的是训练之后的谱位移。)
论文第 4 步用图 6 论证了两件事:① WGeo 的谱是重尾可压缩的;② ΔWFullFT 的谱也是重尾可压缩的。但这两件事各自成立,推不出“ΔWFullFT 的主方向与 WGeo 的主方向重合”——两个矩阵可以都低秩,却张成完全正交的子空间。
论文本可以用一个数字堵上这个缺口:报告 top-r(ΔWFullFT) 与 top-r(WGeo) 的主子空间对齐度。他们已经有计算 SH、ST 的完整工具链,边际成本几乎为零。论文没有报告这个数。
这个缺口还与外部证据存在张力:Mukherjee et al. (2505.11711) 在 7 种 RL 方法、10 个模型族上测得 RL 更新虽然稀疏(只动 5%–30% 参数),但在被更新的矩阵内部是“接近满秩(nearly full-rank)”的。若该结论成立,“RL 更新可用秩-16 适配器捕捉”这个前提本身就需要更强的辩护。
| 场景 | GeoRA 的相对表现 | 幅度 |
|---|---|---|
| Qwen3-8B ΔOOD 领先第二名(LoRA) | 领先 | +1.24pp |
| Llama-3.1-8B ΔOOD 领先第二名(MiLoRA) | 领先 | +0.85pp |
| Llama TruthfulQA | 落后 LoRA | −0.15pp |
| Llama MATH500 | 落后 FullFT | −0.50pp |
| 医学 MedMCQA | 落后 FullFT | −0.25pp |
| 代码均值 / HumanEval | 落后 FullFT | −0.15 / −0.65pp |
方向在两个模型族上一致,这是好的;但效应量在 Llama 上大致减半,论文没有讨论原因。一个可能的解释是 Llama-3.1-8B 的 base IFEval 高达 79.99(Qwen3-8B 仅 54.32),天花板效应压缩了差异——但这需要论文自己去论证。
论文一方面强调双掩码是精心设计的几何先验,另一方面又报告 ρ ∈ {10%,20%,30%,40%} 上“极强鲁棒性”。ρ 从 10% 到 40%,并集覆盖率约从 19% 变到 66%(3.5 倍跨度),若性能几乎不变,更简约的解释是:
w/o M_Spec 和 w/o M_Euc,没有做“随机掩码”这个最关键的对照。缺了它,就无法区分“几何先验有效”与“任何避开主方向的做法都有效”。
| 编号 | 问题类型 | 一句话 | 严重度 |
|---|---|---|---|
| C1 | 实验设计问题 / 论证缺口 | FullFT 三列 OOD 数值与 Base 完全相同 | 🔴 高 |
| C2 | 缺乏关键竞品对比 | 医学 / 代码域缺 PiSSA、MiLoRA、SparseFT | 🔴 高 |
| C3 | 实验设计问题 | 多处优势 = 240 样本中的 1 次 rollout;单次运行无标准差 | 🔴 高 |
| C4 | 指标有效性问题 | SH 由构造保证,接近同义反复 | 🟡 中 |
| C5 | 论证缺口 | 未测 ΔWFullFT 与 WGeo 的主子空间对齐度 | 🔴 高 |
| C6 | 可复现性风险 | 代码未公开 + 多处实现细节未约束 | 🟡 中 |
| C7 | 失手的子任务 | 代码域输给 FullFT;Llama 上效应量减半 | 🟡 中 |
| C8 | 论证缺口 | 缺“随机掩码”对照,无法排除“只要避开主方向即可” | 🟡 中 |
① 解决了什么问题。全量微调的存储与部署成本不可接受。LoRA 把权重更新约束为低秩形式 ΔW = BA(B 零初始化、A 随机高斯),可训练参数压到千分之一量级,推理时可合并回主干、零额外延迟。
② 遗留了什么缺口。LoRA 对“BA 应该落在权重空间的哪个位置”完全不作规定——A 是随机的。既然更新被限制在一个 r 维子空间里,这个子空间的选择应当是重要的。LoRA 把这个自由度整个留给了随机性。
③ 核心工作的回应。GeoRA 继承结构、否定初始化的中立性。有趣的是,表 1 里朴素 LoRA 的 ΔOOD 是 +0.86pp(Qwen)/ +0.79pp(Llama),优于 PiSSA、SparseFT 和 FullFT——在 RLVR 下,“随机而中立”竟然比“聪明但方向错误”更安全。这是 GeoRA 隐含但未点破的重要旁证。
④ 关键设计的传递。前向结构(冻结主干 + 可训练低秩旁路) 与 α/r 缩放 被完整继承;随机初始化 被完全替换。
① 解决了什么问题。LoRA 的零初始化导致早期梯度信号弱、收敛慢。PiSSA 用 W 的主奇异分量初始化适配器,冻结残差。收益扎实:Mistral-7B GSM8K 72.86% vs LoRA 67.7%(+5.16pp);LLaMA-3-70B QPiSSA 86.05% vs QLoRA 81.73%(+4.32pp)。
② 遗留了什么缺口。PiSSA 建立在一个未言明的前提上:“信息量最大的方向”=“最该被训练的方向”。这在 SFT 下大致成立,但从未在“目标是在保持能力的前提下提升特定技能”的 RL 场景下被检验过。它也没讨论:当训练目标带有 KL 约束时,把容量放在主方向上会不会系统性违反该约束。
③ 核心工作的回应。GeoRA 是对 PiSSA 的直接对抗性回应:接受其技术骨架(SVD 初始化 + 残差冻结 + 函数保持),但把 SVD 的对象从 W 换成 WGeo。量化为 SH 从 0.95 降到 0.015(两个数量级)、NSS 从 0.418 降到 0.096(4.4×)、ΔOOD 从 −2.44pp 翻转为 +2.10pp。PiSSA 因此扮演双重角色:既是技术来源,也是首要靶子。
④ 关键设计的传递。SVD 初始化、Σ^{1/2} 对称分摊、残差冻结、randomized SVD 加速 四项完整继承。技术迁移形式:从“谱的哪一段”→“谁的谱”。
① 解决了什么问题。与 PiSSA 同期但结论相反:主奇异分量承载的是值得保护的预训练知识,次要分量代表“未被充分优化”的空间。因此把适配器初始化在 bottom-r 子空间上。
② 遗留了什么缺口。MiLoRA 抓住了正确直觉(保护主方向),但机制仍是纯谱的——只看奇异值排序,不看参数在权重空间中的分布。它没回答:幅值接近零的权重(可塑性高)与低奇异能量的方向(曲率低)是不是同一回事?GeoRA 表 5 的答案是明确的“不是”:Jaccard 仅 0.128,交集 4.55%。MiLoRA 只覆盖了两个互补维度中的一个。
③ 核心工作的回应。GeoRA 是对 MiLoRA 的综合与超越:把选择准则从一维(谱)扩展为二维(谱 ∪ 欧氏)。ST 从 0.90–0.92 提升到 0.96–0.98,NSS 从 0.125–0.132 降到 0.092–0.096(改善约 27%)。但也正因 MiLoRA 已把 ΔOOD 做到正值,GeoRA 相对 MiLoRA 的增量(+1.93pp / +0.85pp)才是衡量“双掩码是否真的必要”的正确基准,而非相对 PiSSA 的 +4.54pp(见 C8)。
④ 关键设计的传递。避开主奇异子空间 的直觉被继承并强化。技术迁移形式:从“一维谱排序”→“二维几何筛选”。
① 解决了什么问题。PPO 需要维护与策略同规模的 value 网络。GRPO 用同一 prompt 的一组 rollout 的组内相对优势替代 value 基线,去掉 critic,保留 KL 正则项。
② 遗留了什么缺口。GRPO 定义了全新的优化动力学(组相对优势 + 显式 KL + 稀疏二元奖励),结果是梯度信号稀疏、噪声大、更新幅度被 KL 硬性限制。但整个 PEFT 生态没有做过任何适配性重新设计——LoRA、PiSSA、MiLoRA、DoRA 全部是在稠密监督 + 无 KL 约束的 SFT 假设下开发和调参的。这笔“方法学债务”就是 GeoRA 的直接问题来源。
③ 核心工作的回应。GeoRA 是第一批直接偿还这笔债务的工作之一:所有实验以 GRPO 为底座(KL 系数 0.001,rollout = 8),并把“KL 是否受控”提升为核心评价维度。冻结残差作为 leash 的设计意图正是针对 KL 约束。
④ 关键设计的传递。GRPO 目标 原样采用;KL 散度 从训练超参上升为评价指标与设计目标。
① 解决了什么问题。提出并验证了一个纯经验结论:在 PPO、GRPO、DPO 等 7 种 RL 方法、10 个模型族上,RL 后训练只改动 5%–30% 的参数;只微调这个子网络就能完全恢复测试准确率,得到的模型与全量微调几乎相同。且这种稀疏性是内生的。
② 遗留了什么缺口。① 稀疏子网络是如何被选出来的?给出了事后识别方法,但没有事前预测规则。② 稀疏是否蕴含低秩?论文自己的测量给出否定暗示——被更新的矩阵内部是“接近满秩”的。
③ 核心工作的回应。对缺口 ① 的回应是直接的:双掩码就是一个事前的、只依赖预训练权重 W 的子网络预测规则。对缺口 ② 的回应是间接且不完整的(见 C5)。
④ 关键设计的传递。RL 更新是稀疏的 作为前提被引入;稀疏 ≠ 低秩 作为自我设障被主动强化;事后识别 被升级为 事前预测规则。
推动力不是技术能力的增长,而是目标函数性质的改变。SFT 的目标是让模型学会新分布,此时“改动大”往往等价于“学得快”;RLVR 的目标是在 KL 球内提升特定可验证技能,此时“改动大”直接等价于“违反约束 + 能力塌缩”。同一个初始化方法在两种目标下的最优性完全相反——PiSSA 在 GSM8K SFT 上 +5.16pp,在数学 RLVR 的 OOD 上 −2.44pp。
| 转折 | 之前 | 之后 | 标志性证据 |
|---|---|---|---|
| T1 初始化从中立变为有偏 | LoRA 随机初始化 | PiSSA / MiLoRA 谱初始化 | PiSSA GSM8K +5.16pp |
| T2 优化范式从 SFT 变为 RL | 稠密监督、无 KL | 稀疏二元奖励、显式 KL | GRPO 去 critic |
| T3 评价从单目标变为双目标 | 只看 ID 提升 | ID + OOD 保持并列 | GeoRA 表 1 的 4+5 结构 |
| T4 分解对象从 W 变为 f(W) | 所有方法都对 W 做 SVD | GeoRA 对 WGeo 做 SVD | SH 0.95 → 0.015 |
值得注意的是,ACL 2026 的 Outstanding Paper 里同时出现了 GeoRA(几何视角)和 Rethinking Entropy Interventions in RLVR(熵视角)——两篇都在处理 RLVR 训练稳定性,一个从参数空间几何入手,一个从策略分布熵入手,目前完全没有交叉验证,是一个明显的空白。
| 工作 | 年月 | 会议 | 核心贡献 | 主要指标 | 与核心工作的关系 |
|---|---|---|---|---|---|
| LoRA | 2021.06 | ICLR 2022 | 低秩更新约束 + 零初始化 | 参数量 ↓1000×;RLVR 下 ΔOOD = +0.86pp | 提供前向结构;其“随机初始化”被否定,但在 RL 下反而优于 PiSSA |
| GRPO / DeepSeekMath | 2024.02 | arXiv | 组相对优势,去 critic,显式 KL | 成为 RLVR 事实标准优化器 | 实验底座;KL 从超参升级为设计准则 |
| PiSSA | 2024.04 | NeurIPS 2024 Spotlight | top-r 主分量初始化 + 残差冻结 | Mistral-7B GSM8K 72.86 vs 67.7(+5.16pp,SFT) | 技术骨架来源 + 首要靶子;RLVR 下 SH=0.95, ΔOOD=−2.44pp |
| MiLoRA | 2024.06 | NAACL 2025 | bottom-r 次分量初始化 | RLVR 下 SH=0.16, NSS=0.132, ΔOOD=+0.17pp | 核心直觉来源;准则被从一维扩展为二维 |
| RL Finetunes Small Subnetworks | 2025.05 | arXiv | RL 更新的内生稀疏性 | 7 种 RL × 10 模型族;仅动 5%–30% 参数;“接近满秩” | 提供前提(稀疏)与最强反证(满秩);GeoRA 只回应了前者 |
| GeoRA(核心) | 2026.01 (v4: 2026.07) | ACL 2026 Main Outstanding | 把 SVD 的对象从 W 换成几何筛选后的 WGeo | ΔID +7.56 / ΔOOD +2.10pp;SH=0.015;参数 −99.5%,单步 −19.9%,显存 −28.5% | 汇聚点 |
| LoRA-RLPO / RLMO | 2026.06 | arXiv | 正交初始化(B₀=0),去掉奇异值缩放 | GSM8K / MATH500 / AIME 上优于 LoRA,1.5B–7B 一致 | 竞争性后续;诊断为“奇异值缩放放大梯度范数”,与 GeoRA 不同;无 head-to-head |
O1 · KL 预算约束下的最优子空间选择问题。具体问题:给定 KL 预算 ε、秩预算 r 和预训练权重 W,是否存在可计算的判据 J(S),使得在所有 r 维子空间中,最大化 J 的子空间同时最小化 KL 违约概率?
GeoRA 的双掩码是纯启发式的,没有任何最优性论证。这是一个高价值、低门槛的空白:在二次近似下(把 RL 损失展开为 ½ΔWᵀHΔW,H 为 Fisher 信息矩阵),“最低曲率的 r 维子空间”有闭式解——就是 H 的 bottom-r 特征子空间。GeoRA 的谱先验实际上是这个解的一个不用计算 Hessian 的粗糙代理。直接比较“KFAC 近似的 Fisher bottom-r 子空间”与“双掩码 + SVD”,就能测出这个代理损失了多少,用现成工具即可完成。
O2 · 稀疏性与低秩性的可兼容边界。具体问题:在什么条件下,一个稀疏支撑集上的矩阵必然具有快速衰减的奇异谱?给出充分条件与反例族。GeoRA 用经验对照建立了“稀疏 ≠ 低秩”,但没刻画边界;而 2505.11711 报告 RL 更新“接近满秩”。这中间存在一个可用随机矩阵理论处理的干净问题:支撑集的几何结构(而非稀疏度本身)决定了低秩性。
O3 · 补上 GeoRA 自己缺的三个实验(最低成本、最高回报):
| 实验 | 具体设计 | 回答什么 |
|---|---|---|
| E1 · 随机掩码对照 | 把 MSpec ∪ MEuc 换成“随机保留 35.45% 的非 top-r 条目”,其余流程不变,在 Qwen3-8B 上重跑表 1 | 区分“几何先验有效” vs “任何避开主方向的做法都有效”(C8) |
| E2 · 主子空间对齐度测量 | 跑一次 FullFT 得 ΔWFullFT,计算 top-r(ΔWFullFT) 与 top-r(WGeo) 的主角度,与 PiSSA、MiLoRA 对比 | 填补最严重的论证缺口(C5);成本近乎为零 |
| E3 · 3 种子重跑 | 表 1 的 Qwen3-8B 分块用 3 个种子重跑并报告标准差 | 把“多 1 个 rollout”的差异变成可判定的结论(C3) |
O4 · GeoRA vs LoRA-RLPO/RLMO 的 head-to-head。固定 GRPO 实现、同一训练集(DeepMath-103K)、同一 KL 系数(0.001)、同一硬件预算、同一秩 r=16,对比六种初始化,同时报告 ID/OOD 双轴与 KL 轨迹。这是当前该方向最关键的实验空白:两篇工作对“PiSSA 为何在 RL 下失败”给出了不同诊断,缺少 head-to-head,社区无法判断哪个诊断是对的——甚至无法排除二者说的是同一件事的两个侧面。
O5 · 动态掩码。ρ 在训练中固定为 0.2。若允许 ρ 或掩码本身随训练步数演化(早期宽松、后期收紧),能否在同样 KL 预算下取得更高 ID 增益?图 7(b) 显示 ρ ∈ [10%,40%] 上性能平坦,这反而是动态调度有空间的信号——若不同阶段的最优 ρ 不同,静态最优就会是各阶段最优的折中,表现为曲线平坦。
O6 · 逐层 / 逐模块的掩码预算分配。表 5 显示 MLP 与 Attn 的 Jaccard 已有差异(0.131 vs 0.119),暗示两类模块几何结构不同,但 GeoRA 对所有层用同一个 ρ。可借鉴 AdaLoRA 的预算分配思想:按层的谱能量分布或 Fisher 迹自适应分配 ρ_ℓ 与 r_ℓ。
O7 · 几何视角与熵视角的交叉验证。参数空间的几何约束(GeoRA 的 Wres leash)与策略空间的熵干预(Rethinking Entropy Interventions in RLVR)是否作用于同一失败模式?测量:在 GeoRA 训练中记录策略熵轨迹,看它是否自动避免了熵坍缩;反之在熵干预方法上测 NSS 与 SH。若二者正交则可叠加获益;若本质在治同一个病则叠加会饱和。两种结果都有信息量,而目前没有任何工作做过。
O8 · 超越 verifiable rewards。在偏好类奖励(RLHF / DPO)下,奖励更稠密但更嘈杂,KL 约束通常更紧。GeoRA 的“低曲率子空间”假设是否仍适用?可操作的切入点:在 DPO 上重跑表 6 的三个几何指标,看 PiSSA 的 SH–NSS–性能链条是否还是单调的。
O9 · 掩码的可解释性与安全含义。MSpec ∪ MEuc 选出的 35.45% 参数在功能上对应什么?是否与已知的“安全对齐相关”参数子集重叠?若系统性避开,则 GeoRA 顺带提供了“能力提升不损伤对齐”的机制保证;若恰好覆盖,则对齐税风险反而被放大。所需实验只是把掩码与已有的对齐关键参数定位工作做一次集合比较。
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective(2026.08,ACL 2026 Main · Outstanding)
CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement(2026.08,ACL 2026 Main · Outstanding)
Evolutionary Guided Decoding: Iterative Value Refinement for LLMs(2026.08,ACL 2026 Main · Outstanding)
Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR(2026.06,arXiv)
Understanding and Preventing Entropy Collapse in RLVR(2026.05,ACL 2026 Findings)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking(2026.04,ICLR 2026 LLM Reasoning Workshop)
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts(2026.01,arXiv)
Do Post-Training Algorithms Actually Differ? Scale-Dependent Ranking Inversions(2026.03,arXiv)
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility(2026.08,arXiv)
GeoRA 的贡献可以压缩成一句话:它是第一批认真对待“SFT 的 PEFT 工具箱不能直接搬到 RLVR 上”这件事的工作,并给出了一个概念上干净的解法——换掉做 SVD 的那个矩阵。
它最强的证据是表 6 的 SH–NSS–ΔOOD 三点单调链条(PiSSA 0.95/0.418/−2.44 → MiLoRA 0.16/0.132/+0.17 → GeoRA 0.015/0.096/+2.10),以及表 1 中“唯一 ID 与 OOD 双向正增益”这个结构性事实。