0. 链接验证表
下表中的 URL 均在本次报告撰写时实际访问;“未找到/未公开”表示没有在论文、官方页面或作者仓库中核实到独立资源,而不是断言资源绝对不存在。
| 论文 | 会议主页 / 出版页 | arXiv(具体版本) | Code 仓库 | 数据集 / 权重 | 项目页 / 视频 |
|---|---|---|---|---|---|
| PARQ | ICML 2025 / PMLR;OpenReview | 2503.15748v1,2025-03-19 | facebookresearch/parq;已进入 torchao prototype | CIFAR-10、ImageNet 使用公开标准数据;论文未发布新数据集或训练权重 | 未找到独立项目页 / 视频 |
| BinaryConnect | NeurIPS 2015 论文记录 | 1511.00363v3,2016-04-18 | 未核实到论文作者的独立官方仓库 | 未发布新数据 / 权重 | 未找到 |
| BinaryRelax | SIAM J. Imaging Sciences 出版记录 | 1801.06313v3,2018-09-05 | 作者 GitHub 主页可见 binaryrelax 仓库 | 未发布新数据 / 权重 | 未找到 |
| ProxQuant | ICLR 2019 OpenReview | 1810.00861v3,2019-03-05 | allenbai01/ProxQuant | 未发布新数据 / 权重 | 未找到 |
| ProxConnect / Demystifying BinaryConnect | NeurIPS 2021 proceedings | 2110.13220v1,2021-10-25 | 未核实到独立官方仓库 | 未发布新数据 / 权重 | 作者页面(含 arXiv / video) |
1. 选择过程与候选池
去重索引显示最近 14 天已覆盖 DuoAttention(KV cache 稀疏保留)与 SimbaV2(深度 RL 优化几何),没有覆盖“QAT 的近端优化与凸正则化”。本次从 ICML 2025、NeurIPS 2025 的效率、系统、量化、长上下文与低秩方向建立 20 篇候选池:Star Attention、RAPID、Reward-Guided Speculative Decoding、GPTAQ、Q-VDiT、LRA-QViT、SeedLoRA、BDIA-Transformer、BlockDialect、RWKVQuant、xLSTM 7B、SketchTune、KVTuner、OrthoRank、PARQ、Learned Prefix Caching、MARS、ClusterFusion、HiFC、LLM 数值非确定性分析。候选清单及已验证主页保存于同目录 candidates_2026-08-21.txt。
按要求执行 shuf -i 1-20 -n 1,结果为 15,对应 PARQ。论文正文、三张完整结果表、三次随机种子统计、算法、开源实现与理论证明均可访问,因此重抽 0 次。
2. 核心论文深度解析
2.1 Motivation:真正的痛点是“离散目标没有可用梯度”
量化推理希望权重只落在有限集合 (\mathcal Q) 中,例如 1-bit 的 ({-q,+q})、三值的 ({-q,0,+q}) 或 2-bit 的四个对称值。这样能减少模型存储与乘加成本;但训练目标 (f(Q(u))) 对潜变量 (u) 的真实导数几乎处处为零,因为阶梯量化函数 (Q) 的导数几乎处处是零。STE 的做法是反向传播时把 (dQ/du) 当作 1,于是用 (\nabla f(Q(u))) 更新全精度潜变量。它有效,却留下两个明确问题:第一,零导数被替成一并不是普通意义上的近似;第二,偏置梯度的稳定性与最终迭代点为何可用,缺少与大规模深网训练直接匹配的保证(论文第 2 页,式 2–3)。
这个痛点不是抽象的理论洁癖。论文表 1–3 说明,方法差异恰恰在最受约束的 1-bit 场景放大:PARQ 相对 STE 在六个模型上的平均提升为 0.615 pp,相对提升均值 0.91%;而到 4-bit 时平均只剩 0.043 pp。最强单点是 CIFAR-10 / ResNet-20 1-bit,从 STE 的 89.56% 提到 90.48%,绝对 +0.92 pp、相对 +1.03%。这意味着优化方法的价值不是“量化越多越快”这种常识,而是当可行集合极窄、硬投影更容易让训练跳变时,连续到离散的路径是否稳定。
与前驱相比,新问题是三层同时成立:既要让正则器真正诱导离散结构(需要非光滑性),又要避免 W 形非凸正则把参数困在错误谷底(需要凸性),还要让最后一个训练迭代点而非平均点收敛,因为多个离散点的平均通常并不离散。PARQ 的“凸 + 非光滑 + last iterate”组合正是针对这三个要求组织的。
2.2 论文故事线:从反驳 STE 的梯度叙事到构造可执行替代
论文首先把 BinaryConnect 写成两变量更新:全精度 (u_t) 累积在量化权重 (w_t=Q(u_t)) 上计算的梯度。这个重写把注意力从“伪造导数”转移到“历史梯度如何经过映射产生结构化参数”。随后作者问:如果稀疏性可由 (\ell_1) 的非光滑拐点诱导,那么能否在每个目标量化值处制造拐点?答案是分段仿射正则 PAR。
第二个转折是:普通 Prox-SGD 的正则强度随步长 (\eta_t) 缩小,软阈值死区会消失,量化作用反而在训练后期衰减。作者因此不使用当前步长,而用累计步长 (\gamma_t=\sum_{s=1}^t\eta_s) 缩放正则,得到 AProx。这样,随训练推进,近端图从斜率接近 1 的近似恒等映射,逐渐变为台阶式硬量化。
第三个转折是理论到工程的断层:真实模型无法为每层预先手调量化中心 (q_k)、斜率 (a_k) 与 (\lambda)。PARQ 每步用 LSBQ 从潜权重在线估计目标值集合 (Q_t),再独立调度斜段逆斜率 (\rho_t^{-1}:1\rightarrow0)。这牺牲了“实践算法完全等同于理论 AProx”的纯粹性,换来 optimizer-only 接口:模型前向和反向代码不必修改。
隐含权衡也很清楚:PARQ 仍保留全精度潜变量与在线量化中心计算,因此它主要降低部署时权重表示与算术成本,而不是直接降低 QAT 的训练显存;它用连续退火减小硬量化跳变,却引入了退火起止与 steepness 等新超参;理论处理凸损失,但实证对象是非凸深网,二者之间靠经验而不是定理连接。
2.3 形式化定义与机制解剖
目标集合记为 (\mathcal Q={0,\pm q_1,\ldots,\pm q_m}),其中 (0=q_0<q_1<\cdots<q_m)。PAR 正则定义为(论文式 6,第 4 页):
其中 (0\le a_0<a_1<\cdots<a_m=+\infty),(b_0=0),且
最大仿射函数的形式保证凸性;斜率在 (\pm q_k) 发生跳变,形成非光滑反射点,使最优性条件允许大量坐标精确停在量化值。优化目标是
普通 Prox-SGD 使用 (\mathrm{prox}_{\eta_t\lambda\Psi}),当 (\eta_t\to0) 时趋于恒等映射。AProx 改成(论文式 11,第 7 页):
在凸、Lipschitz 条件下,论文定理 3.2 给出最后迭代点界(第 9 页):
重要的不是速率新到多快,而是对象是 (w_t) 而非 (\bar w_t)。若每个 (w_t) 都是离散值,平均 (\bar w_t) 往往落回连续空间;所以 last-iterate 保证才与可部署量化模型同构。
实践 PARQ 的伪代码(论文算法 1,第 10 页)可压缩为:
输入:初值 w1、bit 数 n、学习率 ηt、逆斜率日程 ρt^{-1}
u1 ← w1
for t = 1 ... T-1:
ut+1 ← ut - ηt ∇f(wt, zt)
Qt+1 ← LSBQ(ut+1, n) # 在线估计 2^n 个量化值
wt+1 ← prox_PARQ(ut+1, Qt+1, ρt) # 从软映射逐步变成硬台阶
return wT
全精度潜变量 u ──在量化权重 w 上算梯度──► 梯度累积
│ │
└──── LSBQ 在线估计 Q_t ◄──────────────┘
│
PARQ 近端映射,ρ^{-1}: 1 → 0
│
近似全精度(早期)→ 软聚类(中期)→ 硬量化(末期)
| 机制 / 维度 | 设计选择 | 动机 | 关键超参或实现事实 |
|---|---|---|---|
| 结构正则 | 凸、非光滑、分段仿射 (\Psi) | 同时制造离散拐点并避免 W 形错误谷底 | 对称 (Q);可扩展非对称 |
| 优化器 | Aggregate Prox / AProx | 避免 (\eta_t\to0) 导致正则消失 | (\gamma_t=\sum_s\eta_s) |
| 量化中心 | 每步 LSBQ 在线估计 | 不手调各层 (q_k) | 1-bit 有闭式;>2-bit 使用 greedy foldable 近似 |
| 软到硬日程 | (\rho_t^{-1}) 单调由 1 降至 0 | 初期跟随 FP,末期保证硬量化 | 论文可用 cosine / sigmoid;代码暴露 anneal_start/end/steepness |
| 集成方式 | optimizer-only | 不改模型 forward/backward | 基础优化器可为 SGD/Adam/AdamW |
| 分组量化 | ResNet-50/DeiT 按通道;部分层保留 FP | 降低大模型精度损失 | DeiT embedding、LayerNorm、最终 projection 保持 FP |
2.4 工程细节
CIFAR-10 实验量化 ResNet-20/56 的全部权重,包括最终投影层;训练 200 epoch,SGD momentum 0.9、weight decay (2\times10^{-4}),初始学习率 0.1,在 80/120/150 epoch 各衰减 10 倍(论文第 11 页)。ImageNet / ResNet-50 对 residual block 权重逐通道量化,SGD 学习率 0.1、momentum 0.9、weight decay (10^{-4}),每 30 epoch 衰减 10 倍。
DeiT-Ti/S/B 分别约 5M/22M/86M 参数,训练 300 epoch,AdamW 学习率 (5\times10^{-4})、weight decay 0.05。最后 20 epoch 把学习率固定在 (10^{-8}),论文明确说这比默认最小值 (10^{-5}) 更好;此时 PARQ 与 BinaryRelax 已进入硬量化。代码示例显示 2-bit DeiT 使用 8 GPU、per-channel LSBQ、steepness 50;ResNet-50 示例 steepness 75。这里要警惕:论文没有给出等算力训练时长、每 step 的 LSBQ 开销或 kernel 级推理速度,因而“效率”主要被展示为低比特表示可行,而非端到端系统吞吐提升。
2.5 实验设计、基准与统计
| 数据 / 模型 | 规模与任务 | 量化范围 | 指标 | 运行次数 |
|---|---|---|---|---|
| CIFAR-10 / ResNet-20 | 10 类图像分类 | 全部权重,1/T/2/3/4-bit | Top-1 test accuracy(%) | 3 seeds |
| CIFAR-10 / ResNet-56 | 10 类图像分类 | 全部权重,1/T/2/3/4-bit | Top-1 test accuracy(%) | 3 seeds |
| ImageNet / ResNet-50 | 1000 类图像分类 | residual block 权重逐通道 | Top-1 test accuracy(%) | 3 seeds |
| ImageNet / DeiT-Ti | 5M 参数 Transformer | attention block 权重逐通道;若干层 FP | Top-1 test accuracy(%) | 3 seeds |
| ImageNet / DeiT-S | 22M 参数 Transformer | 同上 | Top-1 test accuracy(%) | 3 seeds |
| ImageNet / DeiT-B | 86M 参数 Transformer | 同上 | Top-1 test accuracy(%) | 3 seeds |
论文只有三个 head-to-head QAT 方法,不能诚实扩成“六方法矩阵”。下表因此保留作者报告的完整三方法 × 六模型结果;数值均来自论文表 1–3。为控制表宽,这里选信息量最大的 1-bit 与 2-bit;随后再给五种位宽的聚合矩阵。
| 方法 / 位宽 | R20/C10 | R56/C10 | R50/IN | DeiT-Ti/IN | DeiT-S/IN | DeiT-B/IN |
|---|---|---|---|---|---|---|
| STE 1-bit | 89.56±0.18 | 91.55±0.33 | 66.17±0.04 | 51.62±0.18 | 70.07±0.03 | 78.79±0.03 |
| BinaryRelax 1-bit | 89.98±0.13 | 91.75±0.37 | 66.14±0.28 | 52.62±0.03 | 70.69±0.07 | 79.02±0.03 |
| PARQ 1-bit | 90.48±0.26 | 91.34±0.37 | 66.71±0.13 | 52.51±0.19 | 71.06±0.02 | 79.35±0.04 |
| STE 2-bit | 91.22±0.15 | 92.72±0.27 | 72.38±0.10 | 64.81±0.15 | 77.40±0.01 | 80.73±0.17 |
| BinaryRelax 2-bit | 91.57±0.06 | 92.30±0.40 | 72.64±0.17 | 65.20±0.04 | 77.43±0.04 | 80.81±0.14 |
| PARQ 2-bit | 91.71±0.03 | 92.77±0.10 | 72.43±0.03 | 65.32±0.06 | 77.63±0.04 | 80.84±0.06 |
| 位宽 | PARQ 相对 STE 平均绝对提升 | 平均相对提升 | PARQ 胜过逐模型最强基线 | 对逐模型最强基线的平均差 |
|---|---|---|---|---|
| 1-bit | +0.615 pp | +0.910% | 4/6 | +0.203 pp |
| Ternary | +0.270 pp | +0.298% | 4/6 | -0.065 pp |
| 2-bit | +0.240 pp | +0.313% | 5/6 | +0.055 pp |
| 3-bit | +0.117 pp | +0.171% | 2/6 | -0.100 pp |
| 4-bit | +0.043 pp | +0.059% | 2/6 | -0.078 pp |
全文最有说服力的定量证据不是某个最高准确率,而是位宽梯度:PARQ 对 STE 的平均优势从 1-bit 的 +0.615 pp 单调缩小到 4-bit 的 +0.043 pp(本报告依据表 1–3 复算)。这与“软到硬路径主要缓解极端离散约束”高度一致。另一方面,PARQ 并非普遍最优:DeiT-Ti ternary 为 60.99%,比 BinaryRelax 的 62.18% 低 1.19 pp;DeiT-B 4-bit 为 80.35%,比 BinaryRelax 的 80.76% 低 0.41 pp。
2.6 消融、超参敏感性与相变
论文没有提供“LSBQ → PAR 正则 → 聚合步长 → 独立斜率日程”的逐层消融表,因此不能把最终提升定量归因到某一模块。STE、BinaryRelax、PARQ 的对照改变了正则几何和退火方向,是方法级对比,不是严格单变量消融。可观察的动态证据来自图 10–13:2-bit DeiT-Ti 早期 PARQ 训练损失贴近 FP;斜率快速变化阶段损失上升;末期贴近 STE。图 11 在 epoch 6、150、300 展示近端映射由斜线到台阶;图 12 说明 DeiT-S 1-bit 中 PARQ 没有 STE/BinaryRelax 的突发准确率下降;图 13 显示 (q_1,q_2) 先快速扩张再缓慢回缩。
这里存在一个定性的“相变窗口”:当 (\rho^{-1}) 尚接近 1 时模型近似全精度;过渡区斜率变化导致训练损失抬升;(\rho^{-1}\to0) 后进入硬量化。论文没有公布图 10 的可机读逐 epoch 数值,也没有对 anneal_start、anneal_end、steepness 做网格表,因此无法报告相变精确阈值或置信区间。仓库给出的 DeiT steepness 50、ResNet-50 steepness 75 证明该超参随架构调整,但尚不能说明鲁棒范围。
统计方面,表 1–3 每格是 3 个随机种子的均值±标准差。论文未报告置信区间、显著性检验或逐种子原始值。以 ResNet-20 1-bit 为例,PARQ–STE 差 0.92 pp,而标准差分别 0.26、0.18,效应明显大于单方标准差;但 DeiT-B ternary 的 0.01 pp 优势与 0.01/0.08 的标准差同量级,不能据此宣称稳定领先。
2.7 真正贡献、可复用设计与迁移潜力
真正贡献不是“又做了一个量化器”,而是把三套原本分离的语言接上:工程中的 STE、优化中的 dual averaging/proximal map、结构学习中的非光滑正则。这样一来,STE 可以被视为软映射极限,而不是孤立技巧;量化值、正则几何和退火路径成为可检查的设计对象。
最可复用的是 optimizer-only 抽象。工程团队可以保持模型定义、forward、loss 与 backward 不变,只给参数组指定 bit 数,并替换优化器包装层。第二个可复用原则是“在线估计离散中心 + 独立调度离散强度”:中心 (Q_t) 适配层内分布,(\rho_t) 控制何时硬化,二者不再被一个 (\lambda) 混在一起。第三个是 last-iterate 评估意识:任何以离散结构为目标的训练,平均迭代点可能破坏结构,理论与日志都应追踪最终点而非只追踪平均损失。
迁移空间包括稀疏化、聚类权重、混合精度与向量量化。只要目标结构可表达为一组非光滑反射点或分组近端映射,就可能沿用 AProx 思路;但对非对称、非均匀、激活量化和大语言模型,计算开销与非凸性都必须重新验证。
2.8 局限性:论文自述与补充批判
论文没有独立 Limitations 章节,以下“自述边界”均来自正文明确限定,不能误写成作者主动列出的风险清单。
- 理论作用域:第 2–3 节的收敛分析假设每个样本损失对权重凸、目标 Lipschitz;第 5 节却是 ResNet/DeiT 非凸训练。作者只把证明表述为 convex optimization 的 last-iterate guarantee,没有声称覆盖深网。
- 高 bit 的 LSBQ 近似:第 10 页明确说 (n>2) 没有闭式解,使用 greedy foldable 表示。这意味着 3/4-bit 量化中心不是全局最小平方误差保证。
- 有限训练与理论累计强度不一致:第 10 页承认理论要求 (\gamma_t\to\infty),有限步与衰减学习率下只能到“不很大的常数”,因此实践另设 (\rho) 日程吸收这一差异。
补充批判:
- [论证缺口] 理论—实证断裂。 因为定理 3.2 要求凸损失,而全部主实验是非凸 ResNet/DeiT,所以“last-iterate convergence 解释实际优越性”只能作为机制启发,不能从定理推出。建议在凸 logistic regression 与小型非凸网络上同时记录目标 gap、离散率和 last iterate,做同一日程的 head-to-head。
- [缺乏关键竞品对比] 基线只有 2 个。 因为表 1–3 只对 STE 与 BinaryRelax,而论文相关工作讨论 ProxQuant/ProxConnect,故无法判断 PARQ 相对最接近的近端方法提升来自凸 PAR 还是调参差异。应在同一代码、同一 LSBQ、同一增强下加入 ProxQuant、ProxConnect。
- [实验设计问题] 没有逐模块消融。 因为在线 LSBQ、aggregate scaling、软到硬斜率和最终 20 epoch 的 (10^{-8}) 学习率同时存在,所以 +0.615 pp 的 1-bit 均值不能归因给凸正则本身。建议 2×2×2 因子实验拆开中心更新、聚合步长与 annealing。
- [失手的子任务] 优势并不单调。 因为 DeiT-Ti ternary 的 60.99% 比 BinaryRelax 62.18% 低 1.19 pp,DeiT-B 4-bit 低 0.41 pp,所以“更稳定、常到更好局部极小”的结论主要适用于低 bit/部分模型,而非跨位宽统治。
- [指标有效性问题] 没有真实效率。 因为论文只报 Top-1 accuracy,没有模型字节数、训练吞吐、推理延迟、能耗或专用低比特 kernel,故不能从“n-bit 权重”直接推出端到端速度。尤其 DeiT 的 embedding、LayerNorm、final projection 保持 FP,实际压缩率也不是简单的 32/n。
- [统计证据问题] 三种子仍不足以支撑微小差。 因为 DeiT-B ternary 仅 +0.01 pp、DeiT-S 4-bit 仅 +0.04 pp,且某些标准差达到 0.08/0.12,所以这些胜负可能落在随机波动内。至少应报告配对 seeds、95% CI 与多重比较校正。
- [可复现性风险] 论文超参报告不闭合。 因为正文只描述 cosine/sigmoid 可选,仓库示例却对 DeiT 用 steepness 50、ResNet-50 用 75,且未给敏感性曲线,所以跨架构迁移仍需要重新搜索。代码公开显著降低了风险,但没有消除调参预算偏差。
- [外部有效性] 没有语言模型、激活量化和真实部署。 因为全部 30 个量化配置来自图像分类权重量化,所以不能外推到 LLM 的激活 outlier、KV cache、MoE expert 或生成误差累积。最直接空白是在同一 1B–7B 语言模型上比较权重-only 与 W+A QAT。
3. 相关工作回溯:问题与技术来源链
3.1 BinaryConnect — 2015,NeurIPS
解决了什么。 BinaryConnect 在 forward/backward 使用二值权重,却保留全精度潜权重累积梯度,证明无需让训练状态本身始终是二值也能获得可部署模型。它以加减操作取代乘法的硬件动机与“潜变量—量化变量”双层结构带入主流。
遗留缺口。 反向传播绕过 sign/round 的零导数,本质上采用 STE。该技巧在经验上有效,却没有解释为何把导数从 0 改成 1 不会造成不可控偏置;hard map 从训练第一步开始,也容易使优化轨迹跳变。
PARQ 的回应。 PARQ保留同一双变量框架,但把硬 (Q(u)) 替成随时间变陡的近端映射,早期近似 FP、晚期回到 BinaryConnect。于是 BinaryConnect 成为 PARQ 的渐近端点,而不是需额外辩护的启发式。
设计传递。 “全精度 latent 累积在量化权重上计算的梯度”原样保留;改变的是 latent 到 quantized weight 的映射几何。
3.2 BinaryRelax — 2018,SIAM Journal on Imaging Sciences
解决了什么。 BinaryRelax 不在训练初期硬施加离散集合,而以到量化集合的平方距离(Moreau envelope)连续松弛,并逐渐增加正则强度,最后切换到精确量化的小学习率阶段。它建立了“先软后硬”的 continuation 叙事。
遗留缺口。 平方距离对应平滑、非凸的 W 形几何;平滑性不容易把权重精确吸到离散点,非凸山丘又可能阻止参数从错误谷移动到更优谷。其两阶段切换也可能引入突变。
PARQ 的回应。 PARQ继承 continuation,但把方向改为凸、非光滑 PAR:非光滑拐点负责“吸附”,凸性负责消除 W 形错误谷。表 1–3 直接把 BinaryRelax 作为主要基线;不过 PARQ 只在 17/30 个配置超过 BinaryRelax(本报告由三表复算),说明几何优势并非自动转化为所有模型的准确率优势。
设计传递。 从“正则强度逐渐推向硬约束”演进为“近端斜率逐渐由 1 变为无穷”;二者都把训练时间当作量化自由度。
3.3 ProxQuant — 2019,ICLR
解决了什么。 ProxQuant 把量化训练写成正则化学习问题,在随机梯度之间插入 prox operator,并指出 STE/BinaryConnect 可与 dual averaging 联系。它第一次系统地把 QAT 从伪梯度语言迁移到近端优化语言。
遗留缺口。 ProxQuant 常用到离散集合的距离类非凸正则,且普通 Prox-SGD 中正则影响随学习率缩小;它没有解决“最后迭代点必须保持离散”与“凸正则如何产生多个离散聚类点”的组合问题。
PARQ 的回应。 PARQ 构造凸而多拐点的 PAR,并用累计步长而非当前步长缩放正则,避免末期量化作用消失。理论重点从平均/函数值收敛推进到 last iterate。
设计传递。 prox-between-gradients 的骨架被保留;正则函数、缩放方式与目标证明被替换。
3.4 ProxConnect — 2021,NeurIPS
解决了什么。 ProxConnect进一步说明 BinaryConnect 是 dual averaging 的特例,提出易设计、易分析的 proximal quantizer,并给出收敛结果。它把 BinaryConnect、PTQ 与多种量化算法放到统一优化框架中。
遗留缺口。 PARQ 论文第 3 页明确指出,ProxConnect 的凸正则结果缺少一个能实际诱导多值量化的凸构造,且主要保证平均迭代;平均多个量化点并不保证仍量化。
PARQ 的回应。 AProx 在算法形式上与 ProxConnect 等价,但 PARQ补上两个缺口:具体的凸非光滑 PAR,以及 last-iterate 与平均迭代相同量级的收敛界。
设计传递。 dual-averaging / aggregate gradient 的解释直接进入 AProx;PARQ把抽象的 proximal family 固化为可在 ResNet/DeiT 上运行、能在线估计中心的实现。
PARQ 相对 STE 的平均准确率提升随位宽收缩
六个模型平均绝对提升;单位为百分点(pp)。低位宽收益最明显。
4. 技术演进脉络
2015 BinaryConnect [硬量化前向;FP latent;STE]
│
├── 2018 BinaryRelax [连续松弛;非凸平滑距离;两阶段]
│ │
│ └── 提出“先软后硬”,但存在 W 形谷底与切换突变
│
└── 2019 ProxQuant [正则化 + proximal gradient]
│
└── 2021 ProxConnect [dual averaging 统一;prox family;平均迭代保证]
│
├── 缺具体凸多值量化正则
└── 平均量化点不一定量化
│
2025 PARQ [凸+非光滑 PAR;AProx;last iterate;在线 LSBQ;软→硬日程]
内在推动力是从“绕过不可导”转向“设计优化几何”。早期关心二值权重能否训练;中期关心硬约束能否松弛;随后关心 STE 与 proximal/dual averaging 的统一解释;PARQ 再把注意力落到正则的局部拐点、全局凸性与最后迭代结构。社区关注点也从单一 accuracy 扩展到稳定性、可证明性与代码集成,但 PARQ 仍未完成真实低比特 kernel 与端到端 latency 的最后一公里。
| 工作 | 发表年月 | 会议/出版 | 核心贡献 | 主要证据 | 与 PARQ 的关系 |
|---|---|---|---|---|---|
| BinaryConnect | 2015.12 | NeurIPS 2015 | FP latent + binary forward/backward | MNIST/CIFAR/SVHN 接近当时 SOTA | 算法端点与双变量来源 |
| BinaryRelax | 2018.11 | SIAM JIS | Moreau 平滑松弛 + continuation | CIFAR/ImageNet | 继承软到硬,替换非凸平滑几何 |
| ProxQuant | 2019.05 | ICLR 2019 | 正则化 QAT + prox gradient | ResNet/LSTM | 继承 prox,解决正则衰减与结构保证 |
| ProxConnect | 2021.12 | NeurIPS 2021 | dual averaging 统一与 prox family | CIFAR-10/ImageNet | AProx 形式来源;补具体凸正则和 last iterate |
| PARQ | 2025.07 | ICML 2025 | 凸非光滑 PAR + AProx + 在线 LSBQ | 表1–3:30配置、3 seeds | 汇聚点 |
5. 开放挑战与可操作研究机会
5.1 理论层面
- 非凸 last-iterate 界。 在相同网络、相同噪声假设下,对 AProx、ProxConnect、STE 给出 gradient mapping 或局部稳定点的最后迭代界;实验同时测目标 gap、离散率和 basin 切换次数,验证理论量是否预测准确率。
- 在线 (Q_t) 的耦合分析。 当前定理把 (\Psi) 视作固定,而实践每步用 LSBQ 改变 (Q_t)。可固定一组模型,比较 frozen-Q、每 epoch 更新 Q、每 step 更新 Q,研究漂移速度与收敛误差的界。
- 多值凸非光滑正则的必要性。 在完全相同的 prox kernel 和 schedule 下,对比 convex-PAR、nonconvex-L1 distance、smooth-L2 distance,测过错谷次数、Hessian 谱和最终离散率,以确认“凸性/非光滑性”各自的因果贡献。
5.2 工程与应用层
- 等 GPU-hour QAT。 固定 8×H100、相同 batch 与 wall-clock,比较 STE、BinaryRelax、ProxQuant、PARQ 的 images/s、额外显存、LSBQ 时间占比和最终准确率;这能补上当前只报 accuracy 的关键空白。
- 真实推理 Pareto。 导出 INT1/T/INT2 模型到同一后端,报告模型大小、峰值内存、p50/p99 latency、吞吐与能耗;对保留 FP 的 DeiT 层单独计账,避免把理论 bit-width 当成实际压缩率。
- 退火 schedule 公平比较。 固定总训练步与调参预算,对 cosine、sigmoid、linear 以及 validation-triggered schedule 做 head-to-head;每种报告 10 seeds 与退火区间的 loss spike。
- LLM 扩展。 在同一 1B/7B 模型、相同 token 预算下,对 W1/W2-only 与 W2A8 比较 PARQ、STE、GPTQ-style QAT;指标同时包括 perplexity、zero-shot accuracy、生成稳定性和 tokens/s。
5.3 新兴方向
- MoE 专家自适应量化。 比较全专家共享 (Q)、每 expert 独立 (Q_e)、按路由频率分组 (Q_g),固定总 bit 预算,观察长尾专家是否因样本少而中心漂移。
- 激活与 KV cache 的时变量化。 将 PAR 的反射点扩展到 token/通道条件形式,和静态 per-channel quantization 在相同 context length、batch 与显存预算下比较;重点测 outlier token 的误差传播。
- 结构组合。 在相同压缩率下对比“PARQ only”“structured sparsity only”“PARQ+sparsity”,检查两个非光滑结构正则是否竞争;报告实际 kernel 加速而非只报理论 FLOPs。
6. 其他值得关注的近期工作
- GPTAQ(2025.07,ICML 2025):用相对于全精度层输出的 asymmetric calibration 减少层间量化误差累积,适合与 PARQ 的训练时优化几何对照。
- KVTuner(2025.07,ICML 2025):按层敏感性分配 KV cache 混合精度,代表“bit 预算也是可学习资源”的系统方向。
- BlockDialect(2025.07,ICML 2025):面向 LLM 全路径矩阵乘的细粒度 mixed-format;论文主页报告其相对 MXFP4 的准确率优势,值得追踪硬件格式与 QAT 的耦合。
- RWKVQuant(2025.07,ICML 2025):针对 RWKV 非线性算子阻碍平滑/旋转融合的问题设计 proxy-guided PTQ,提醒量化不能脱离架构算子。
- Q-VDiT(2025.07,ICML 2025):为视频 DiT 设计 token-aware error compensation 与蒸馏目标,重点在时间维量化误差。
- xLSTM 7B(2025.07,ICML 2025):从 recurrent architecture 而非压缩入手换取长生成效率,适合与低比特 Transformer 做等质量吞吐比较。
- Learned Prefix Caching(2025.12,NeurIPS 2025):学习会话是否继续来指导 prefix cache eviction,报告在等命中率下减少 18–47% cache、仿真 prefill throughput +11%。
7. 结论
PARQ 最重要的价值,是把 QAT 的“经验技巧”改写成可拆解的三个对象:目标量化中心、结构诱导正则与时间退火路径。复算表 1–3 后,证据最强的区域是 1–2 bit:1-bit 对 STE 六模型平均 +0.615 pp,2-bit 在 5/6 模型上超过逐模型最强基线;但它没有在所有位宽获胜,也没有给出真实 latency、能耗或 LLM 结果。因而更准确的结论是:PARQ 提供了一条更有原则、在极低 bit 时更稳健的训练路径,但尚未证明它是端到端系统上更快或跨架构普适的量化方案。
数据来源说明:核心公式、算法、实验设置与数值来自 PARQ arXiv PDF 第 2–13 页、表 1–3、算法 1、图 10–13;所有二次平均、绝对 pp 与相对百分比由报告基于原表复算。论文未报告逐模块消融、超参网格、置信区间、推理延迟和能耗,本报告均未补造。HTML 已通过 Warm Editorial 结构、依赖、语义与占位符验证(0 errors / 0 warnings);运行环境未提供 /usr/bin/chromium、/opt/pw-browsers 或其他可执行 Chromium,且按约束未运行浏览器安装,因此无法完成 Playwright 的浅色、深色、移动端截图核验,已保留响应式、打印与主题切换规则并明确记录这一验证缺口。