ML/AI 每日深度论文追踪 · 周一 · LLM / NLP

GeoRA:为 RLVR 重新设计的几何感知低秩适配

当 SFT 时代的 PEFT 工具箱撞上强化学习的 KL 约束——一次关于“该动哪些参数”的重新提问

ACL 2026 Main · Outstanding Paper 2026-08-10 arXiv:2601.09361 (v4, 2026-07-31) post-training × PEFT 候选池 24 篇 · 随机抽取 · 重抽 0 次

一句话定位:GeoRA 把参数高效适配的“适配对象”从预训练权重矩阵 W 本身,换成了一个先经几何筛选、再做 SVD 的代理矩阵 WGeo——它不再问“哪个子空间表达力最强”(SFT 视角),而是问“哪个子空间被扰动的代价最低”(RL 视角)。

0. 元信息与坦诚性声明

项目说明
领域轮转周一(date +%u = 1)→ LLM / NLP:推理与 test-time scaling、post-training、评测基准
候选池24 篇(ACL 2026 Main Best/Outstanding/Resource/Theme 11 篇 + ACL 2026 Findings 2 篇 + ICLR 2026 与近 8 个月 arXiv 11 篇)
抽取方式shuf -i 1-24 -n 5 取首位 → #3 = GeoRA;重抽 0 次
去重索引⚠️ 未能访问。本次为云端计划任务运行,桌面端未连接,ml-report-index.md 不可达,14 天去重无法自动校验
材料来源arXiv HTML 全文(v3 / v4)+ ACL Anthology 元数据页;未获取 PDF 原始排版
已知不完备之处① 图 3–7 为曲线图,只能引用文字描述;② 表 8(1.5B/4B)抽取仅得 GeoRA 行,故不作横向比较;③ 论文未公开代码,实现细节无法交叉验证

1. 链接验证表

以下链接均在本次运行中通过实际访问确认可达;未确认者明确标注。

论文会议 / AnthologyarXivCode备注
核心:GeoRA ACL 2026 Long #1110
pp. 24207–24221
arXiv:2601.09361
v1 2026-01-14 / v4 2026-07-31
未公开 Outstanding Paper
LoRA ICLR 2022 arXiv:2106.09685 microsoft/LoRA abs 页 WebFetch 被 provenance 拦截
PiSSA NeurIPS 2024 Spotlight arXiv:2404.02948 GraphPKU/PiSSA 全文已读
MiLoRA NAACL 2025 Long #248 arXiv:2406.09044 sufenlp/MiLoRA Anthology 页已读
RL Finetunes Small Subnetworks 未找到 venue 页 arXiv:2505.11711 未找到 摘要与关键数字已读
DeepSeekMath / GRPO 技术报告 arXiv:2402.03300 deepseek-ai/DeepSeek-Math GeoRA 的 RL 优化器来源
LoRA-RLPO / RLMO 未找到 arXiv:2606.31813 未找到 abs 页返回空文本,内容经第三方综述交叉确认
链接层面的坦诚说明:arxiv.org/abs/2106.09685arxiv.org/abs/2406.09044huggingface.co/papers 三处触发了抓取代理的 provenance / 限流拦截。它们的 URL 形态由搜索引擎结果确认有效,但本报告没有对这三页做正文级验证

2. Motivation:一个可被量化的几何错配

2.1 痛点的具体形态

论文指向的不是“LoRA 效果不好”这种泛泛之谈。PiSSA 的设计逻辑是把 W 的主奇异分量交给适配器训练——这在 SFT 下有效(PiSSA 原文:Mistral-7B GSM8K 从 LoRA 的 67.7% 提到 72.86%,+5.16pp)。但在 RLVR 下,主奇异方向承载的正是模型已经学好的通用能力

GeoRA 表 1(Qwen3-8B,数学 RLVR 训练后在训练域之外评测)给出了这个代价的直接量化:

OOD 基准BasePiSSA变化折算题数
HumanEval76.8371.95−4.88pp−8 / 164 题
IFEval54.3248.74−5.58pp
TruthfulQA68.9165.95−2.96pp
GPQA36.9136.16−0.75pp
MMLU71.9473.89+1.95pp
反直觉现象即全文起点:一个专为 SFT 设计的、在 SFT 上稳定涨点的初始化方法,在数学 RLVR 上把代码能力打掉了 8 道题、把指令遵循打掉了 5.58pp。而同一张表里,随机初始化的朴素 LoRA 反而把 HumanEval 拉到了 81.10(+4.27pp)——“更聪明的初始化”在 RL 下比“更笨的初始化”更糟。

HumanEval 题数折算依据:76.83% × 164 = 126 题,71.95% × 164 = 118 题,二者均落在 1/164 = 0.61pp 的整数网格上,说明该列数值内部自洽。

2.2 机制性论证:三个几何指标(表 6)

方法Llama NSS↓Llama SHLlama STQwen NSS↓Qwen SHQwen ST
PiSSA0.3950.980.010.4180.950.03
LoRA0.2140.150.150.2350.180.18
MiLoRA0.1250.120.920.1320.160.90
GeoRA0.0920.0050.980.0960.0150.96

PiSSA 的 NSS 是 GeoRA 的 4.3×(0.395/0.092)与 4.4×(0.418/0.096);SH 相差 两个数量级。三行数字把 “SH 高 → NSS 高 → OOD 掉点” 串成一条可检验的链条:PiSSA(0.95, 0.418, −2.44) → MiLoRA(0.16, 0.132, +0.17) → GeoRA(0.015, 0.096, +2.10),三点单调、方向一致

⚠️ 但见批判 C4:SH 低对 GeoRA 而言几乎是构造性保证,而非实验发现。

3. 论文的故事线(论证结构)

论文的论证不是“我们提出了 X,实验显示 X 好”,而是一条五步递进的链条,每一步都在回应上一步留下的反驳:

第 1 步 前提引入 RL 的更新是稀疏的 ← 借自 [Mukherjee et al., 2505.11711]:PPO/GRPO/DPO 等 7 种方法、 10 个模型族上,RL 只改动 5%–30% 的参数 第 2 步 自我设障(关键转折)★ "稀疏 ≠ 低秩" —— 作者主动构造反例: 对随机稀疏噪声做 SVD,谱衰减是"相对平坦"的,与稠密随机噪声无异 ⇒ 光知道"更新稀疏"不足以论证低秩适配器的合理性 第 3 步 提出选择规则(真正的创新点) 若要让"被选中的稀疏区域"同时具备低秩结构, 选择规则必须携带几何信息,而非随机 / 幅度阈值 ⇒ 双掩码:Spectral 先验(低曲率)∪ Euclidean 先验(高可塑) 第 4 步 验证前提成立 图 6:W_Geo 的谱呈显著重尾,与预训练权重 W 的谱形态相似 同时:ΔW_FullFT(真实 RL 全量更新)也呈类似的可压缩重尾谱 第 5 步 加装安全带 冻结残差 W_res 作为 structural anchor(论文用词:leash) ⇒ 图 5:在 5×10⁻⁵ 的激进学习率下,KL 仍"保持在低且可控的水平"
第 2 步是全文最有价值的一步。作者没有直接从“RL 更新稀疏”跳到“用稀疏适配器”,而是先自己把这条捷径堵死了。这个自我设障决定了方法必须是“几何 + 稀疏”的复合体,而非单纯稀疏化——也正是它区别于同期大量“把某某 PEFT 搬到 RL 上”的工作的地方。

隐含的设计权衡

牺牲了什么换来了什么证据
适配容量的表达力上界(只能在低曲率 / 近零权重区域调整)KL 可控性 + OOD 保持表 1:GeoRA OOD 平均 +2.10pp,FullFT −1.43pp
一次性 SVD + 双掩码预处理成本训练全程 −19.9% 单步耗时表 3 + 表 7
主奇异方向的“快速收敛红利”(PiSSA 的核心卖点)训练稳定性图 4/5:PiSSA、MiLoRA 在高学习率下迅速退化

第三行的权衡在数字上其实没有真的被牺牲:GeoRA 在数学 ID 上仍是全表最高(34.04 vs PiSSA 32.27),说明“低曲率区域容量不足”这个担忧在 r=16 的预算下尚未成为瓶颈。这是论文比较幸运的一点,也是它的脆弱点(见批判 C6)。

4. 方法论与机制解剖

4.1 形式化定义

Step 1 — 几何先验构造(双掩码)

谱先验(抑制高幅值 / 高曲率分量): (M_Spec)_{i,j} = 𝟙( |(Ŵ_r)_{i,j}| ≤ τ_Spec(ρ) ) Ŵ_r = SVD_r(W) 欧氏先验(捕捉近零权重的可塑性): (M_Euc)_{i,j} = 𝟙( |W_{i,j}| ≤ τ_Euc(ρ) ) 合成几何约束矩阵(取并集,不是交集): W_Geo = W ⊙ ( M_Spec ∪ M_Euc )

Step 2 — 几何感知分解

W_Geo = U_Geo · Σ_Geo · V_Geoᵀ A_Geo = Σ_Geo[:r,:r]^{1/2} · V_Geo[:,:r]ᵀ B_Geo = U_Geo[:,:r] · Σ_Geo[:r,:r]^{1/2}

Step 3 — 残差牵引(Residual Leash)

W_res = W − (α/r) · B_Geo·A_Geo (冻结) 前向(初始化时函数完全保持,h = Wx): h = W_res·x + (α/r)·B_Geo·A_Geo·x └ Frozen ┘ └────── Trainable ──────┘ 梯度映射(G = ∂L/∂W_eff): ∂L/∂A = (α/r)·Bᵀ·G ∂L/∂B = (α/r)·G·Aᵀ

4.2 三种初始化范式的对照

适配对象 可训练子空间 S_H ΔOOD(Qwen3-8B) LoRA (2021) ───► W (不分解) 随机高斯 + 零 0.18 +0.86 pp PiSSA (2024) ───► W top-r 主分量 0.95 −2.44 pp MiLoRA (2024) ───► W bottom-r 次分量 0.16 +0.17 pp GeoRA (2026) ───► W_Geo ≠ W ★ W_Geo 的 top-r 0.015 +2.10 pp ▲ └── 这一列的改变是 GeoRA 的全部创新所在: 前三者都在争论"在 W 上取哪一段谱", GeoRA 换掉了做 SVD 的那个矩阵本身。

4.3 关键机制表格

机制 / 维度设计选择动机关键超参
参数选择先验Spectral ∪ Euclidean 双掩码稀疏 ≠ 低秩,需几何信息引导ρ = 0.2
适配器初始化对 WGeo 做截断 SVD,Σ1/2 对称分摊让适配器落在低曲率子空间r = 16, α = 32
稳定性锚冻结残差 Wres限制学习流形,控制 KL
RL 目标GRPO组相对优势,无需 value 网络KL 系数 0.001,rollout = 8
初始化加速Randomized SVD把预处理压到训练时间的 0.025%

4.4 掩码的覆盖率与互补性(表 5,Qwen3-8B,ρ = 0.2)

分组MSpecMEuc交集Jaccard并集覆盖率(本报告推算)
MLP20.0%20.0%4.63%0.13135.37%
Attn20.0%20.0%4.25%0.11935.75%
All20.0%20.0%4.55%0.12835.45%
  1. Jaccard ≈ 0.128 说明两个先验几乎不重叠——若它们捕捉的是同一种“不重要参数”,交集应远大于 4.55%。这是论文“互补性”主张的最硬证据。
  2. 并集只保留 35.45% 的权重条目,即 WGeo64.55% 的权重置零后再做 SVD。“WGeo 继承了预训练结构”对一个丢掉近三分之二条目的矩阵而言是相当强的主张(见批判 C5)。

4.5 超参与初始化成本

参数取值扫描范围
rank r16{4, 8, 16, 32}
scaling α32
稀疏比 ρ0.2{10%, 20%, 30%, 40%}
学习率1×10⁻⁶压力测试至 5×10⁻⁵(50×
全局 batch / rollout / KL 系数128 / 8 / 0.001
硬件80GB GPU;数学·医学 1×8 卡,代码 2×8 卡
随机种子单次运行(single random run),不报告标准差
模型操作墙钟时间峰值显存
8B完整训练838 min~384 GB
8B标准 SVD18.87 min16.48 GB
8BRandomized SVD0.21 min15.78 GB
32BRandomized SVD0.26 min28.43 GB
72BRandomized SVD0.72 min140.41 GB

加速比 18.87 / 0.21 = 89.9×(论文表述为“约 100×”,略有夸大但同量级)。相对训练总时长:0.21 / 838 = 0.025%,即初始化开销可忽略。

5. 实验设计与定量结果

5.1 主结果矩阵(表 1,数学 RLVR,Qwen3-8B)

方法AIME24AIME25MATH500OlymMATHID 均值 HumanEvalGPQAMMLUIFEvalTruthfulQAOOD 均值
Base13.3311.6771.209.7526.4976.8336.9171.9454.3268.9161.78
FullFT23.3322.0878.4011.2533.7776.83†36.91†71.94†50.4565.6560.36
SparseFT22.9221.2576.8011.5033.1279.5037.2074.2050.9566.0561.58
LoRA19.5819.5875.6010.7531.3881.1037.5075.6552.1366.8262.64
PiSSA22.5020.4274.4011.7532.2771.9536.1673.8948.7465.9559.34
MiLoRA20.4219.5876.2011.5031.9378.6638.2674.5151.8566.4661.95
GeoRA23.7521.6778.0012.7534.0482.9337.9275.9653.7368.8563.88

† 该三列 FullFT 数值与 Base 完全相同(76.83 / 36.91 / 71.94)——已通过二次定向抓取确认。详见批判 C1。ID / OOD 均值由本报告依表内数值计算。

图 A · 相对 Base 的双轴增益分解(Qwen3-8B,单位 pp)

数据来源:GeoRA 表 1;ID = 4 个数学基准均值,OOD = 5 个域外基准均值。均值与差值由本报告计算。悬停查看数值。

ΔID(域内数学) ΔOOD(域外能力保持)
+8 +6 +4 +2 0 −2 相对 Base 的变化(pp) FullFT SparseFT LoRA PiSSA MiLoRA GeoRA 合计 +5.85 合计 +6.43 合计 +5.75 合计 +3.34 合计 +5.61 合计 +9.66
🔴 全文最有说服力的定量证据:在 Qwen3-8B 上,GeoRA 是唯一一个 ID 与 OOD 双向正增益、且 ID 增益超过全量微调的方法。合计增益比第二名 SparseFT 高 +3.23pp,比 PiSSA 高 +6.32pp(1.9 倍)。更关键的是方向性:所有“更强”的方法(FullFT +7.28 / −1.43、PiSSA +5.78 / −2.44)都在用 OOD 换 ID,只有 GeoRA 打破了这个 trade-off

5.2 Llama-3.1-8B:方向一致,幅度收窄

方法ID 均值OOD 均值ΔIDΔOOD
Base16.4861.49
FullFT24.3760.01+7.89−1.48
SparseFT23.9461.07+7.46−0.42
LoRA21.6662.28+5.18+0.79
PiSSA23.4260.63+6.94−0.86
MiLoRA22.4262.10+5.94+0.61
GeoRA24.5162.95+8.03+1.46

结论方向一致,但幅度显著收窄:GeoRA 的 ΔOOD 领先第二名(MiLoRA)从 Qwen 上的 +1.24pp 缩到 +0.85pp。见批判 C7。

5.3 医学与代码域(表 2)

方法MedQAMedMCQAPubMedQA医学均值LiveCodeBenchHumanEvalMBPP代码均值
Base58.0356.4274.9463.1365.7587.6679.4077.60
FullFT75.3264.5680.1273.3367.7590.2681.4079.80
LoRA74.2362.1279.5471.9667.2588.9681.0079.07
GeoRA76.1264.3180.6473.6967.7589.6181.6079.65
两处失手:MedMCQA 上 GeoRA 64.31 < FullFT 64.56(−0.25pp);代码均值 79.65 < FullFT 79.80(−0.15pp),HumanEval 89.61 < 90.26(−0.65pp)。且这两个域的基线集合被削减到只剩 Base / FullFT / LoRA——PiSSA、MiLoRA、SparseFT 全部缺席,而 PiSSA 恰恰是全文的头号靶子。详见 C2。

5.4 消融研究(表 4,Qwen3-4B)

配置RewardAIME24AIME25MATH-500OlymMATH均值Δ 均值
GeoRA(完整)0.8813.339.1773.405.7525.41
w/o MSpec0.8612.508.3372.004.7524.40−1.01
w/o MEuc0.8313.338.7572.805.5025.10−0.31
⚡ 相变式发现(本报告的独立观察,论文未提及):训练奖励与下游准确率在这两行之间出现了反序。
· w/o M_Spec:reward 0.86(更高) → 均值 24.40(更低)
· w/o M_Euc:reward 0.83(更低) → 均值 25.10(更高)

两重含义:① 这是 RLVR 中“奖励–能力脱钩”的一个微型实例,本身就有价值;② 它直接削弱了论文在图 4/5/7 中把 reward 曲线当作主要证据的做法——如果 reward 与准确率在消融行间都会反向,那么用 reward 曲线论证 r 与 ρ 的鲁棒性就缺乏说服力。

同时,w/o M_Euc 只掉 0.31pp,而论文用它论证“移除任一掩码都会一致地降低性能”。0.31pp 在 4 基准平均、单次运行、且包含 AIME(30 题量级)的设置下,难以与噪声区分

5.5 超参敏感性与统计显著性

扫描维度范围论文报告形式本报告评估
rank r{4, 8, 16, 32}图 7(a) reward 轨迹⚠️ 只有 reward,无下游准确率;结合 §5.4 反序,证据不充分
稀疏比 ρ{10%, 20%, 30%, 40%}图 7(b) reward 轨迹⚠️ 同上
学习率1×10⁻⁶ → 5×10⁻⁵(50×)图 4 / 图 5(含 KL 轨迹)✅ 最有价值的敏感性证据:对应明确的失败模式(训练崩溃),不依赖 reward–accuracy 相关性

论文未报告任何明确的相变或突变点。ρ 从 10% 到 40% 意味着并集覆盖率约从 19% 到 66%(3.5 倍跨度),若性能真的“极强鲁棒”,反而暗示双掩码的具体阈值不是关键变量——这与论文强调“几何先验精确选择”的叙事存在张力(C8)。

论文明确说明结果“基于单次随机运行”,不报告标准差、置信区间或多种子重复

6. 局限性

6.1 第一类:论文自述的限制(Limitations 章节)

#论文原文(英译中)严重度
L1“初始化过程需要执行截断 SVD 和双掩码操作。虽然这是训练开始时的一次性计算成本,但相比标准 LoRA 的随机初始化引入了额外的预处理步骤。”低 —— 表 7 自证仅占训练时间 0.025%
L2“我们的实验主要聚焦于推理域的 RLVR。尽管 GeoRA 在这些任务上表现强劲,其泛化性仍需在更广泛的模型架构和 verifiable rewards 之外的多样 RL 场景中进一步验证。”中 —— 承认范围限制,但未承认下列任何一条

6.2 第二类:补充批判(8 点,均为本报告的独立观察)

C1 · 论证缺口 + 实验设计问题:表 1 中 FullFT 的三列 OOD 数值与 Base 完全相同

Qwen3-8B 上 FullFT 与 Base 在 HumanEval(76.83)、GPQA(36.91)、MMLU(71.94)三列逐位相同;Llama-3.1-8B 上同样三列同样相同(65.20 / 31.15 / 68.40)。而 IFEval 与 TruthfulQA 两列则不同。三个数字在两个不同模型上同时精确复现的概率可忽略,因此只有两种解释:(a) 复制粘贴错误,(b) 这三个基准未对 FullFT 重新评测

剔除这三列后,唯一可信的 OOD 对比只剩 IFEval 和 TruthfulQA。重算如下:

方法Qwen3-8B(IFEval+TruthfulQA 平均 Δ)Llama-3.1-8B
FullFT−3.57−3.69
SparseFT−3.12−2.95
PiSSA−4.27−4.02
LoRA−2.14−1.51
MiLoRA−2.46−1.46
GeoRA−0.33−1.19

结论:论文的核心主张在剔除可疑数据后依然成立(GeoRA 退化最小),但 Qwen 上的领先从“OOD 净增益 +2.10pp”降级为“退化最小,−0.33pp”,“提升 OOD”的措辞不再有依据。而 Llama 上 GeoRA(−1.19)与 MiLoRA(−1.46)、LoRA(−1.51)的差距只有 0.27–0.32pp,已进入噪声量级

图 B · 剔除可疑数据后的 OOD 退化(仅 IFEval + TruthfulQA 两列,单位 pp)

C1 的重算结果。数值越接近 0 越好。两条序列是两个模型族,单位相同,故共用一个纵轴。悬停查看数值。

Qwen3-8B Llama-3.1-8B
0 −1 −2 −3 −4 相对 Base 的退化(pp) FullFT SparseFT PiSSA LoRA MiLoRA GeoRA Llama 上 GeoRA 与 MiLoRA / LoRA 的差距仅 0.27–0.32pp——已进入噪声量级

C2 · 缺乏关键竞品对比:医学与代码域的基线被削减到只剩 3 个

表 2 的基线集合是 {Base, FullFT, LoRA},PiSSA、MiLoRA、SparseFT 全部缺席。这不是无关紧要的省略:全文的靶子就是“PiSSA 类主分量初始化在 RLVR 下有害”。如果这个论断是方法层面的(而非数学任务特有的),它在医学和代码上也应该成立并被验证。保守推断:GeoRA 优于 SVD-based 初始化这一核心论断,目前只有数学域的证据。

C3 · 实验设计问题:多处“优势”小于一个 rollout 样本

论文的 AIME 评测是 30 题 × 8 rollout = 240 个样本,网格步长 1/240 = 0.4167pp。核对数值:

数值折算验证
GeoRA AIME24 = 23.7557 / 24057/240 = 23.750% ✓
FullFT AIME24 = 23.3356 / 24056/240 = 23.333% ✓
GeoRA AIME25 = 21.6752 / 24052/240 = 21.667% ✓
FullFT AIME25 = 22.0853 / 24053/240 = 22.083% ✓
GeoRA 在 AIME24 上“超过全量微调”的全部依据,是 240 次 rollout 中多答对了 1 次;而在 AIME25 上它又少答对 1 次。在单次运行、无标准差的设置下,这两个数字不构成任何可解释的差异。MATH500 上 GeoRA 78.00 vs FullFT 78.40 同理,差 2 / 500 题。

唯一在 ID 上真正稳健的证据是 OlymMATH:GeoRA 12.75 vs FullFT 11.25(+1.50pp),且 GeoRA 在该列是全表最高。OlymMATH 恰好是四个 ID 基准中最难的一个——这一点值得论文自己强调,但它没有。

C4 · 指标有效性问题:表 6 的 SH 接近构造性同义反复

SH 衡量适配器子空间与头部奇异子空间的对齐度。GeoRA 的构造过程显式地把高幅值条目掩掉了,因此 SH ≈ 0.005–0.015 几乎是设计的直接推论,而非需要实验才能知道的经验发现。同理 PiSSA 的 0.95–0.98 也由其定义决定。表 6 因此更接近“设计意图的自我确认”,而非“机制的因果证据”。真正能构成因果链的做法是:构造一族 SH 连续变化的初始化方案,观察 OOD 退化是否随之单调——论文没有做。(NSS 受此影响较轻,因为它测的是训练之后的谱位移。)

C5 · 论证缺口(最严重的一条):证明 WGeo 可压缩 ≠ 证明 RL 所需的更新落在 WGeo 的主子空间中

论文第 4 步用图 6 论证了两件事:① WGeo 的谱是重尾可压缩的;② ΔWFullFT 的谱也是重尾可压缩的。但这两件事各自成立,推不出“ΔWFullFT 的主方向与 WGeo 的主方向重合”——两个矩阵可以都低秩,却张成完全正交的子空间。

论文本可以用一个数字堵上这个缺口:报告 top-r(ΔWFullFT) 与 top-r(WGeo) 的主子空间对齐度。他们已经有计算 SH、ST 的完整工具链,边际成本几乎为零。论文没有报告这个数。

这个缺口还与外部证据存在张力:Mukherjee et al. (2505.11711) 在 7 种 RL 方法、10 个模型族上测得 RL 更新虽然稀疏(只动 5%–30% 参数),但在被更新的矩阵内部是“接近满秩(nearly full-rank)”的。若该结论成立,“RL 更新可用秩-16 适配器捕捉”这个前提本身就需要更强的辩护。

C6 · 可复现性风险:代码未公开,且方法对未公开细节敏感

C7 · 失手的子任务 + 结论强度的跨模型衰减

场景GeoRA 的相对表现幅度
Qwen3-8B ΔOOD 领先第二名(LoRA)领先+1.24pp
Llama-3.1-8B ΔOOD 领先第二名(MiLoRA)领先+0.85pp
Llama TruthfulQA落后 LoRA−0.15pp
Llama MATH500落后 FullFT−0.50pp
医学 MedMCQA落后 FullFT−0.25pp
代码均值 / HumanEval落后 FullFT−0.15 / −0.65pp

方向在两个模型族上一致,这是好的;但效应量在 Llama 上大致减半,论文没有讨论原因。一个可能的解释是 Llama-3.1-8B 的 base IFEval 高达 79.99(Qwen3-8B 仅 54.32),天花板效应压缩了差异——但这需要论文自己去论证。

C8 · 叙事与证据的张力:如果 ρ 真的“极强鲁棒”,几何先验的精确性就不是关键

论文一方面强调双掩码是精心设计的几何先验,另一方面又报告 ρ ∈ {10%,20%,30%,40%} 上“极强鲁棒性”。ρ 从 10% 到 40%,并集覆盖率约从 19% 变到 66%(3.5 倍跨度),若性能几乎不变,更简约的解释是:

真正起作用的可能不是“选中了哪些参数”,而只是“避开了主奇异方向”这一件事。这个替代假设与 MiLoRA 的结论一致(MiLoRA 只做了“避开主分量”,SH = 0.12–0.16,ΔOOD 已转正为 +0.17 / +0.61)。而 GeoRA 相对 MiLoRA 的 OOD 增益是 +1.93pp(Qwen)/ +0.85pp(Llama)——真实但不算巨大。

检验方法很简单:把双掩码换成“随机保留 35.45% 的非主分量条目”作为消融项。论文的表 4 只做了 w/o M_Specw/o M_Euc没有做“随机掩码”这个最关键的对照。缺了它,就无法区分“几何先验有效”与“任何避开主方向的做法都有效”。

批判汇总

编号问题类型一句话严重度
C1实验设计问题 / 论证缺口FullFT 三列 OOD 数值与 Base 完全相同🔴 高
C2缺乏关键竞品对比医学 / 代码域缺 PiSSA、MiLoRA、SparseFT🔴 高
C3实验设计问题多处优势 = 240 样本中的 1 次 rollout;单次运行无标准差🔴 高
C4指标有效性问题SH 由构造保证,接近同义反复🟡 中
C5论证缺口未测 ΔWFullFT 与 WGeo 的主子空间对齐度🔴 高
C6可复现性风险代码未公开 + 多处实现细节未约束🟡 中
C7失手的子任务代码域输给 FullFT;Llama 上效应量减半🟡 中
C8论证缺口缺“随机掩码”对照,无法排除“只要避开主方向即可”🟡 中

7. 相关工作回溯(问题传递链)

7.1 LoRA — 2021.06,ICLR 2022

① 解决了什么问题。全量微调的存储与部署成本不可接受。LoRA 把权重更新约束为低秩形式 ΔW = BA(B 零初始化、A 随机高斯),可训练参数压到千分之一量级,推理时可合并回主干、零额外延迟。

② 遗留了什么缺口。LoRA 对“BA 应该落在权重空间的哪个位置”完全不作规定——A 是随机的。既然更新被限制在一个 r 维子空间里,这个子空间的选择应当是重要的。LoRA 把这个自由度整个留给了随机性。

③ 核心工作的回应。GeoRA 继承结构、否定初始化的中立性。有趣的是,表 1 里朴素 LoRA 的 ΔOOD 是 +0.86pp(Qwen)/ +0.79pp(Llama),优于 PiSSA、SparseFT 和 FullFT——在 RLVR 下,“随机而中立”竟然比“聪明但方向错误”更安全。这是 GeoRA 隐含但未点破的重要旁证。

④ 关键设计的传递。前向结构(冻结主干 + 可训练低秩旁路)α/r 缩放 被完整继承;随机初始化 被完全替换。

7.2 PiSSA — 2024.04,NeurIPS 2024 Spotlight

① 解决了什么问题。LoRA 的零初始化导致早期梯度信号弱、收敛慢。PiSSA 用 W 的主奇异分量初始化适配器,冻结残差。收益扎实:Mistral-7B GSM8K 72.86% vs LoRA 67.7%(+5.16pp);LLaMA-3-70B QPiSSA 86.05% vs QLoRA 81.73%(+4.32pp)。

② 遗留了什么缺口。PiSSA 建立在一个未言明的前提上:“信息量最大的方向”=“最该被训练的方向”。这在 SFT 下大致成立,但从未在“目标是在保持能力的前提下提升特定技能”的 RL 场景下被检验过。它也没讨论:当训练目标带有 KL 约束时,把容量放在主方向上会不会系统性违反该约束。

③ 核心工作的回应。GeoRA 是对 PiSSA 的直接对抗性回应:接受其技术骨架(SVD 初始化 + 残差冻结 + 函数保持),但把 SVD 的对象从 W 换成 WGeo。量化为 SH 从 0.95 降到 0.015(两个数量级)、NSS 从 0.418 降到 0.096(4.4×)、ΔOOD 从 −2.44pp 翻转为 +2.10pp。PiSSA 因此扮演双重角色:既是技术来源,也是首要靶子。

④ 关键设计的传递。SVD 初始化Σ^{1/2} 对称分摊残差冻结randomized SVD 加速 四项完整继承。技术迁移形式:从“谱的哪一段”→“谁的谱”

7.3 MiLoRA — 2024.06,NAACL 2025

① 解决了什么问题。与 PiSSA 同期但结论相反:主奇异分量承载的是值得保护的预训练知识,次要分量代表“未被充分优化”的空间。因此把适配器初始化在 bottom-r 子空间上。

② 遗留了什么缺口。MiLoRA 抓住了正确直觉(保护主方向),但机制仍是纯谱的——只看奇异值排序,不看参数在权重空间中的分布。它没回答:幅值接近零的权重(可塑性高)与低奇异能量的方向(曲率低)是不是同一回事?GeoRA 表 5 的答案是明确的“不是”:Jaccard 仅 0.128,交集 4.55%。MiLoRA 只覆盖了两个互补维度中的一个。

③ 核心工作的回应。GeoRA 是对 MiLoRA 的综合与超越:把选择准则从一维(谱)扩展为二维(谱 ∪ 欧氏)。ST 从 0.90–0.92 提升到 0.96–0.98,NSS 从 0.125–0.132 降到 0.092–0.096(改善约 27%)。但也正因 MiLoRA 已把 ΔOOD 做到正值,GeoRA 相对 MiLoRA 的增量(+1.93pp / +0.85pp)才是衡量“双掩码是否真的必要”的正确基准,而非相对 PiSSA 的 +4.54pp(见 C8)。

④ 关键设计的传递。避开主奇异子空间 的直觉被继承并强化。技术迁移形式:从“一维谱排序”→“二维几何筛选”

7.4 DeepSeekMath / GRPO — 2024.02

① 解决了什么问题。PPO 需要维护与策略同规模的 value 网络。GRPO 用同一 prompt 的一组 rollout 的组内相对优势替代 value 基线,去掉 critic,保留 KL 正则项。

② 遗留了什么缺口。GRPO 定义了全新的优化动力学(组相对优势 + 显式 KL + 稀疏二元奖励),结果是梯度信号稀疏、噪声大、更新幅度被 KL 硬性限制。但整个 PEFT 生态没有做过任何适配性重新设计——LoRA、PiSSA、MiLoRA、DoRA 全部是在稠密监督 + 无 KL 约束的 SFT 假设下开发和调参的。这笔“方法学债务”就是 GeoRA 的直接问题来源。

③ 核心工作的回应。GeoRA 是第一批直接偿还这笔债务的工作之一:所有实验以 GRPO 为底座(KL 系数 0.001,rollout = 8),并把“KL 是否受控”提升为核心评价维度。冻结残差作为 leash 的设计意图正是针对 KL 约束。

④ 关键设计的传递。GRPO 目标 原样采用;KL 散度 从训练超参上升为评价指标与设计目标

7.5 RL Finetunes Small Subnetworks in LLMs — 2025.05

① 解决了什么问题。提出并验证了一个纯经验结论:在 PPO、GRPO、DPO 等 7 种 RL 方法10 个模型族上,RL 后训练只改动 5%–30% 的参数;只微调这个子网络就能完全恢复测试准确率,得到的模型与全量微调几乎相同。且这种稀疏性是内生的

② 遗留了什么缺口。① 稀疏子网络是如何被选出来的?给出了事后识别方法,但没有事前预测规则。② 稀疏是否蕴含低秩?论文自己的测量给出否定暗示——被更新的矩阵内部是“接近满秩”的。

③ 核心工作的回应。对缺口 ① 的回应是直接的:双掩码就是一个事前的、只依赖预训练权重 W 的子网络预测规则。对缺口 ② 的回应是间接且不完整的(见 C5)。

④ 关键设计的传递。RL 更新是稀疏的 作为前提被引入;稀疏 ≠ 低秩 作为自我设障被主动强化;事后识别 被升级为 事前预测规则

8. 技术演进脉络

2021.06 LoRA [低秩约束、随机初始化、零初始化保证起点等价、α/r 缩放] │ 留下缺口:子空间选择完全交给随机性 ▼ ┌─────────────────────┬─────────────────────┐ │ │ │ 2024.02 GRPO/DeepSeekMath 2024.04 PiSSA 2024.06 MiLoRA [组相对优势、去 critic、 [top-r 主分量初始化] [bottom-r 次分量初始化] 显式 KL 约束] S_H≈0.95 S_H≈0.16 │ │ │ │ 改变了优化范式 │ 假设"信息量大=该训练" │ 直觉正确但准则是一维的 │ 但 PEFT 未随之更新 │ 在 RL 下 ΔOOD=−2.44 │ ΔOOD=+0.17(已转正) │ │ │ └──────────┬──────────┴──────────┬──────────┘ │ │ │ 2025.05 RL Finetunes Small Subnetworks │ [RL 只动 5%–30% 参数;但"接近满秩"] │ 留下缺口:① 如何事前预测子网络 │ ② 稀疏是否蕴含低秩(暗示:否) │ │ └──────────┬──────────┘ ▼ ┌────────────────────────────────────────────┐ │ 2026.01 GeoRA ★ 汇聚点 │ │ • 继承 PiSSA 的 SVD 初始化 + 残差冻结 │ │ • 继承 MiLoRA 的"避开主方向"直觉 │ │ • 继承 LoRA 的前向结构与 α/r 缩放 │ │ • 回应稀疏子网络工作的"事前预测"缺口 │ │ • 以 GRPO 的 KL 约束为设计准则 │ │ ⇒ 关键动作:换掉做 SVD 的那个矩阵 │ │ W_Geo = W ⊙ (M_Spec ∪ M_Euc) │ │ S_H≈0.015, NSS≈0.096, ΔOOD=+2.10 │ └────────────────────┬───────────────────────┘ │ 未回答:ΔW_FullFT 与 W_Geo 主子空间是否对齐? ▼ 2026.06 LoRA-RLPO / RLMO [正交初始化,B₀=0] 诊断不同:问题在"奇异值缩放放大梯度范数 → 违反 KL 约束 → 训练崩溃" ⇒ 与 GeoRA 竞争同一个解释位;二者无 head-to-head

演进的内在逻辑:评价函数的迁移

"哪个子空间表达力最强" ──► "哪个子空间收敛最快" ──► "哪个子空间扰动代价最低" (LoRA: 不关心) (PiSSA: SFT 视角) (MiLoRA→GeoRA: RL 视角)

推动力不是技术能力的增长,而是目标函数性质的改变。SFT 的目标是让模型学会新分布,此时“改动大”往往等价于“学得快”;RLVR 的目标是在 KL 球内提升特定可验证技能,此时“改动大”直接等价于“违反约束 + 能力塌缩”。同一个初始化方法在两种目标下的最优性完全相反——PiSSA 在 GSM8K SFT 上 +5.16pp,在数学 RLVR 的 OOD 上 −2.44pp。

阶段间的关键转折

转折之前之后标志性证据
T1 初始化从中立变为有偏LoRA 随机初始化PiSSA / MiLoRA 谱初始化PiSSA GSM8K +5.16pp
T2 优化范式从 SFT 变为 RL稠密监督、无 KL稀疏二元奖励、显式 KLGRPO 去 critic
T3 评价从单目标变为双目标只看 ID 提升ID + OOD 保持并列GeoRA 表 1 的 4+5 结构
T4 分解对象从 W 变为 f(W)所有方法都对 W 做 SVDGeoRA 对 WGeo 做 SVDSH 0.95 → 0.015
T3 可能是这条线上影响最深远的一步,而它甚至不是 GeoRA 的显式主张。把 OOD 保持从“顺带提一句”提升为与 ID 提升并列的评价轴,意味着 RLVR 的成功标准被重新定义了:一个只提升 AIME 却打掉 HumanEval 的方法不再算成功。

社区关注点的转移

值得注意的是,ACL 2026 的 Outstanding Paper 里同时出现了 GeoRA(几何视角)和 Rethinking Entropy Interventions in RLVR(熵视角)——两篇都在处理 RLVR 训练稳定性,一个从参数空间几何入手,一个从策略分布熵入手,目前完全没有交叉验证,是一个明显的空白。

9. 相关工作表格对标

工作年月会议核心贡献主要指标与核心工作的关系
LoRA2021.06ICLR 2022低秩更新约束 + 零初始化参数量 ↓1000×;RLVR 下 ΔOOD = +0.86pp提供前向结构;其“随机初始化”被否定,但在 RL 下反而优于 PiSSA
GRPO / DeepSeekMath2024.02arXiv组相对优势,去 critic,显式 KL成为 RLVR 事实标准优化器实验底座;KL 从超参升级为设计准则
PiSSA2024.04NeurIPS 2024 Spotlighttop-r 主分量初始化 + 残差冻结Mistral-7B GSM8K 72.86 vs 67.7(+5.16pp,SFT)技术骨架来源 + 首要靶子;RLVR 下 SH=0.95, ΔOOD=−2.44pp
MiLoRA2024.06NAACL 2025bottom-r 次分量初始化RLVR 下 SH=0.16, NSS=0.132, ΔOOD=+0.17pp核心直觉来源;准则被从一维扩展为二维
RL Finetunes Small Subnetworks2025.05arXivRL 更新的内生稀疏性7 种 RL × 10 模型族;仅动 5%–30% 参数;“接近满秩”提供前提(稀疏)与最强反证(满秩);GeoRA 只回应了前者
GeoRA(核心)2026.01
(v4: 2026.07)
ACL 2026 Main
Outstanding
把 SVD 的对象从 W 换成几何筛选后的 WGeoΔID +7.56 / ΔOOD +2.10pp;SH=0.015;参数 −99.5%,单步 −19.9%,显存 −28.5%汇聚点
LoRA-RLPO / RLMO2026.06arXiv正交初始化(B₀=0),去掉奇异值缩放GSM8K / MATH500 / AIME 上优于 LoRA,1.5B–7B 一致竞争性后续;诊断为“奇异值缩放放大梯度范数”,与 GeoRA 不同;无 head-to-head

表格读出的三条趋势线

  1. SH 单调下降:0.95(PiSSA)→ 0.16(MiLoRA)→ 0.015(GeoRA),伴随 ΔOOD 单调上升:−2.44 → +0.17 → +2.10。三点共线,是全文最干净的趋势。
  2. 参数效率的边际收益已经饱和:GeoRA 的 0.04B 相对 LoRA 同量级并无优势——本文的价值不在参数量,而在稳定性。表 3 里真正新的数字是“单步耗时 −19.9%”和“显存 −28.5%”。
  3. 诊断正在分岔:GeoRA(子空间位置错了)vs LoRA-RLPO(奇异值缩放导致梯度范数爆炸)。两个诊断都能解释 PiSSA 在 RL 下的失败,但推出的解法完全不同。这是 2026 下半年该方向最值得关注的分歧点。

10. 开放挑战与研究机会

10.1 理论层面

O1 · KL 预算约束下的最优子空间选择问题。具体问题:给定 KL 预算 ε、秩预算 r 和预训练权重 W,是否存在可计算的判据 J(S),使得在所有 r 维子空间中,最大化 J 的子空间同时最小化 KL 违约概率?

GeoRA 的双掩码是纯启发式的,没有任何最优性论证。这是一个高价值、低门槛的空白:在二次近似下(把 RL 损失展开为 ½ΔWᵀHΔW,H 为 Fisher 信息矩阵),“最低曲率的 r 维子空间”有闭式解——就是 H 的 bottom-r 特征子空间。GeoRA 的谱先验实际上是这个解的一个不用计算 Hessian 的粗糙代理。直接比较“KFAC 近似的 Fisher bottom-r 子空间”与“双掩码 + SVD”,就能测出这个代理损失了多少,用现成工具即可完成。

O2 · 稀疏性与低秩性的可兼容边界。具体问题:在什么条件下,一个稀疏支撑集上的矩阵必然具有快速衰减的奇异谱?给出充分条件与反例族。GeoRA 用经验对照建立了“稀疏 ≠ 低秩”,但没刻画边界;而 2505.11711 报告 RL 更新“接近满秩”。这中间存在一个可用随机矩阵理论处理的干净问题:支撑集的几何结构(而非稀疏度本身)决定了低秩性。

10.2 工程与应用层

O3 · 补上 GeoRA 自己缺的三个实验(最低成本、最高回报):

实验具体设计回答什么
E1 · 随机掩码对照把 MSpec ∪ MEuc 换成“随机保留 35.45% 的非 top-r 条目”,其余流程不变,在 Qwen3-8B 上重跑表 1区分“几何先验有效” vs “任何避开主方向的做法都有效”(C8)
E2 · 主子空间对齐度测量跑一次 FullFT 得 ΔWFullFT,计算 top-r(ΔWFullFT) 与 top-r(WGeo) 的主角度,与 PiSSA、MiLoRA 对比填补最严重的论证缺口(C5);成本近乎为零
E3 · 3 种子重跑表 1 的 Qwen3-8B 分块用 3 个种子重跑并报告标准差把“多 1 个 rollout”的差异变成可判定的结论(C3)

O4 · GeoRA vs LoRA-RLPO/RLMO 的 head-to-head。固定 GRPO 实现、同一训练集(DeepMath-103K)、同一 KL 系数(0.001)、同一硬件预算、同一秩 r=16,对比六种初始化,同时报告 ID/OOD 双轴与 KL 轨迹。这是当前该方向最关键的实验空白:两篇工作对“PiSSA 为何在 RL 下失败”给出了不同诊断,缺少 head-to-head,社区无法判断哪个诊断是对的——甚至无法排除二者说的是同一件事的两个侧面。

O5 · 动态掩码。ρ 在训练中固定为 0.2。若允许 ρ 或掩码本身随训练步数演化(早期宽松、后期收紧),能否在同样 KL 预算下取得更高 ID 增益?图 7(b) 显示 ρ ∈ [10%,40%] 上性能平坦,这反而是动态调度有空间的信号——若不同阶段的最优 ρ 不同,静态最优就会是各阶段最优的折中,表现为曲线平坦。

O6 · 逐层 / 逐模块的掩码预算分配。表 5 显示 MLP 与 Attn 的 Jaccard 已有差异(0.131 vs 0.119),暗示两类模块几何结构不同,但 GeoRA 对所有层用同一个 ρ。可借鉴 AdaLoRA 的预算分配思想:按层的谱能量分布或 Fisher 迹自适应分配 ρ_ℓ 与 r_ℓ。

10.3 新兴方向

O7 · 几何视角与熵视角的交叉验证。参数空间的几何约束(GeoRA 的 Wres leash)与策略空间的熵干预(Rethinking Entropy Interventions in RLVR)是否作用于同一失败模式?测量:在 GeoRA 训练中记录策略熵轨迹,看它是否自动避免了熵坍缩;反之在熵干预方法上测 NSS 与 SH。若二者正交则可叠加获益;若本质在治同一个病则叠加会饱和。两种结果都有信息量,而目前没有任何工作做过。

O8 · 超越 verifiable rewards。在偏好类奖励(RLHF / DPO)下,奖励更稠密但更嘈杂,KL 约束通常更紧。GeoRA 的“低曲率子空间”假设是否仍适用?可操作的切入点:在 DPO 上重跑表 6 的三个几何指标,看 PiSSA 的 SH–NSS–性能链条是否还是单调的。

O9 · 掩码的可解释性与安全含义。MSpec ∪ MEuc 选出的 35.45% 参数在功能上对应什么?是否与已知的“安全对齐相关”参数子集重叠?若系统性避开,则 GeoRA 顺带提供了“能力提升不损伤对齐”的机制保证;若恰好覆盖,则对齐税风险反而被放大。所需实验只是把掩码与已有的对齐关键参数定位工作做一次集合比较。

11. 其他值得关注的近期工作

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective(2026.08,ACL 2026 Main · Outstanding)

CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement(2026.08,ACL 2026 Main · Outstanding)

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs(2026.08,ACL 2026 Main · Outstanding)

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR(2026.06,arXiv)

Understanding and Preventing Entropy Collapse in RLVR(2026.05,ACL 2026 Findings)

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking(2026.04,ICLR 2026 LLM Reasoning Workshop)

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts(2026.01,arXiv)

Do Post-Training Algorithms Actually Differ? Scale-Dependent Ranking Inversions(2026.03,arXiv)

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility(2026.08,arXiv)

12. 总结

GeoRA 的贡献可以压缩成一句话:它是第一批认真对待“SFT 的 PEFT 工具箱不能直接搬到 RLVR 上”这件事的工作,并给出了一个概念上干净的解法——换掉做 SVD 的那个矩阵。

它最强的证据是表 6 的 SH–NSS–ΔOOD 三点单调链条(PiSSA 0.95/0.418/−2.44 → MiLoRA 0.16/0.132/+0.17 → GeoRA 0.015/0.096/+2.10),以及表 1 中“唯一 ID 与 OOD 双向正增益”这个结构性事实。

它最需要补的是三个成本极低的实验:随机掩码对照(排除 C8 的替代假设)、ΔWFullFT 与 WGeo 的主子空间对齐度测量(填补 C5 的核心论证缺口)、多种子重跑(让 C3 的“1 个 rollout 差异”变成可判定结论)。在这三个实验完成之前,“双掩码这个具体形式是必要的”这一主张仍然是未经检验的——已被检验的只是“避开主奇异方向是必要的”,而这一点 MiLoRA 在 2024 年就说过了。