0. 链接验证表与证据口径
以下链接均在 2026-08-28 实际访问;数字只采用已下载并逐页读取的论文 PDF。网页用于身份、版本和资源可用性验证,不用二手页面补实验数字。
| 资源 | 已验证链接 | 状态与日期 |
|---|---|---|
| MLSys 2025 论文页 | Proceedings | 已收录于第 8 届 MLSys,2025 |
| arXiv | 2405.04532 | v1 2024-05-07;v2 2024-05-10;v3 2025-05-01 |
| arXiv v3 PDF | 已下载并读取,15 页正文与附录 | |
| 代码 | OmniServe / QServe | 已公开,Apache-2.0;README 说明 2025-02 统一 QServe/LServe |
| 量化模型/权重 | OmniServe model zoo | 已公开多种 Llama/Mistral/Yi 模型;部分 70B/72B 链接或权重可用性需逐模型确认 |
| 基准数据 | QServe-benchmarks | 已公开;论文仍依赖 WikiText2、LongBench 等上游数据 |
| 项目页 | MIT HAN Lab | 已公开,含主要图与摘要 |
| 视频 | 未找到官方论文讲解视频 | 截至核验日未找到可归因于作者的正式视频 |
来源标记规则:表格中的“表 2/4/5”“图 16/17/19”均指 QServe v3 PDF;“本报告复算”只做除法、差值或几何含义解释,不从图中猜测未标出的精确数值。论文未报告重复试验、标准差、置信区间或显著性检验,本文不会补造。
1. 候选池、排重与随机选择
先审阅 ml-report-index.md,排除最近 14 天已深度覆盖的
DuoAttention、PARQ、Q-VDiT 及其近重复主题。候选来自 ICML/MLSys 2025
proceedings、arXiv、OpenReview、Hugging Face、Papers with Code 与
Semantic Scholar 的交叉检索,共 26 篇:
| # | 候选 | 方向/来源 |
|---|---|---|
| 1 | Star Attention | 长上下文稀疏注意力,arXiv 2024 |
| 2 | Oscillation-Reduced MXFP4 Training | 低精训练,ICML 2025 |
| 3 | Dynamic Token Aggregation for DETR | token 剪枝,ICML 2025 |
| 4 | LongRoPE2 | 上下文扩展,ICML 2025 |
| 5 | RWKVQuant | 状态空间模型量化,ICML 2025 |
| 6 | SkipGPT | 动态层跳过,ICML 2025 |
| 7 | Skrr | 文生图编码器复用,ICML 2025 |
| 8 | Targeted Low-rank Refinement | 稀疏模型修复,ICML 2025 |
| 9 | Randomized Subspace Optimization for LLMs | 内存高效训练,ICML 2025 |
| 10 | Olica | 激活压缩,ICML 2025 |
| 11 | Determining Layer-wise Sparsity | 结构剪枝,ICML 2025 |
| 12 | Ferret | 联邦全参微调,ICML 2025 |
| 13 | Cache Me If You Must | KV cache/推理,ICML 2025 |
| 14 | GANQ | 生成式量化,ICML 2025 |
| 15 | Pivoting Factorization | 低秩压缩,ICML 2025 |
| 16 | MoEQuant | MoE 量化,ICML 2025 |
| 17 | SepLLM | 分段注意力,arXiv 2024 |
| 18 | Core Context Aware Transformers | 长上下文,arXiv 2025 |
| 19 | QServe | 量化—服务协同,MLSys 2025 |
| 20 | TurboAttention | KV/注意力压缩,MLSys 2025 |
| 21 | FlashInfer | 服务注意力引擎,MLSys 2025 |
| 22 | Dynamic Input Pruning & Cache-Aware Masking | 推理剪枝,2025 |
| 23 | Mixture Compressor for MoE | MoE 压缩,2025 |
| 24 | Universal Model Routing | 多模型路由,2025 |
| 25 | MoE-Infinity | MoE 服务,2025 |
| 26 | DistServe | prefill/decode 解耦,2024 |
在本地执行 shuf -i 1-26 -n 1 得到
19,故选择
QServe。没有重抽:论文、附录、代码、模型与基准材料充足,且“服务内核协同”与近期的训练量化
PARQ、视频量化 Q-VDiT 不构成主题重复。
2. Motivation:INT4 为什么可能越量化越慢
量化叙事通常从带宽和 Tensor Core 峰值出发:A100 的 FP16、INT8、INT4 Tensor Core 吞吐分别为 312、624、1248 TOPS,DRAM 带宽约 2 TB/s(论文第 4 页、图 3)。若只看这组数字,W4A4 应该比 W8A8 更快。然而 QServe 的起点是实测的 20%–90% 解量化开销(摘要与第 2 页):INT4 权重或 INT32 partial sum 必须在 CUDA cores 上做缩放、零点处理和类型转换;在 A100 上,一次 CUDA core 操作的代价可相当于约 50 次 INT4 Tensor Core 操作(第 2 页)。因此,主循环里几条“便宜的”标量指令,就可能让更快的矩阵乘单元等待。
论文给出两类失败模式:
- W4A16:权重存为 INT4,但 GEMM 用 FP16 Tensor
Core,主循环要把权重反量化回 FP16;它适合小 batch 的 memory-bound
区域。roofline 分析显示 A100 上约在 batch 维度
m < 78时 W4A16 有利,batch 再增大则计算与反量化成为瓶颈(第 4 页、图 3)。 - W4A4:为了精度常给 activation 做 group-wise 量化,INT32 partial sums 需在 K 维分组间多次缩放并转浮点。论文测得 Atom/QuaRot 类内核的解量化占比可到 90%(第 14 页、图 18)。
服务场景又让问题更尖锐:decode 的 KV cache 随序列长度和 batch 线性增长,attention 占端到端时间 30%–50%(第 10 页,§5.3)。权重 4 bit 却保留 KV8/16,只解决了一半内存墙;把 KV 直接压到 4 bit,又会因位操作和分支增加计算。论文实测,朴素 KV4 在 L40S 上相对 KV8 快 1.7×,但在 A100 上反而慢 1.2×(第 10 页)。这构成真正的系统问题:怎样让权重路径少用 CUDA core,同时让 KV4 attention 仍停留在 memory-bound 区域?
3. 故事线、假设与权衡
QServe 的故事线可以压成三个连续判断:
- 判断 A:精度组合要服从服务 roofline。 W4A16 在小 batch 好,W8A8 在大 batch 好;所以选 W4A8,让权重带宽减半、矩阵乘走 INT8 Tensor Core。
- 判断 B:算法格式必须让系统容易反量化。 QoQ 不是任意 W4A8,而是先做 per-channel INT8,再在 INT8 域做 group-wise INT4,使解量化可变成寄存器内整数乘减。
- 判断 C:KV4 的收益需靠 attention 内核兑现。 SmoothAttention 负责精度,位技巧、控制流简化、FP16 QK/SV 与异步预取负责把算术强度压回带宽瓶颈。
它接受的权衡也很明确:W4A8KV4 并非最低算术位宽,理论 Tensor Core 峰值不如 W4A4;但它减少 CUDA-core 串行工作,以更高的“有效吞吐”换取较温和的精度损失。硬件相关性很强:论文在 A100 推荐 per-channel W4A8,在 CUDA core 更强的 L40S 推荐 g128 group quantization(第 12–13 页)。
4. 方程级形式化与流程
设权重块为 (W),第一阶段 per-channel 对称量化到保护区间 ([-119,119]):
[ s_c=\frac{\max |W_c|}{119},\qquad W^{(8)}_c=\operatorname{clip}!\left(\operatorname{round}(W_c/s_c),-119,119\right). ]
第二阶段按 group 做 4-bit 非对称量化:
[ q_{c,g}=\operatorname{clip}!\left(\operatorname{round}(W^{(8)}{c,g}/s{c,g})+z_{c,g},0,15\right), \quad \widehat W_{c,g}=s_c,s_{c,g}(q_{c,g}-z_{c,g}). ]
关键不是普通的二级量化外形,而是 [-119,119]
留出的溢出余量:QServe 可在寄存器中并行 unpack INT4,先乘整数
scale、再减预计算的 zero-point compensation,避免 GEMM 主循环里的 FP16
反量化(论文第 5–7 页,图 6–9)。
对注意力,标准计算为
[ O=\operatorname{softmax}(QK^\top/\sqrt d)V. ]
SmoothAttention 为每个通道引入缩放 (\lambda_j),令 (K'_j=K_j/\lambda_j, Q'_j=Q_j\lambda_j),于是 (Q'K'^\top=QK^\top) 保持不变。论文按通道统计 K 的幅值,并取平滑强度 (\alpha)(经验上 0.5 良好),把难量化的 K outlier 转移到无需缓存量化的 Q(第 7–8 页,式 5–7)。
流程伪代码:
输入:FP16 模型、校准样本、目标 GPU
1 对每个 block 搜索旋转/缩放与 clipping,使 block-output MSE 最小
2 权重先 per-channel -> INT8[-119,119],再 group -> UINT4
3 估计 K 通道幅值;用 SmoothAttention 把 K outlier 平移到 Q
4 按目标 GPU 选择 per-channel(A100) 或 g128(L40S)
5 离线重排 W4 pack,使相邻 Tensor Core 消费的数据减少地址计算
6 decode 时:W4 寄存器解包 -> INT8;W4A8 GEMM 在 INT8 Tensor Core 执行
7 KV4 fused attention:bit tricks -> 简化控制流 -> FP16 QK/SV -> async prefetch
输出:W4A8KV4 checkpoint 与最大吞吐服务引擎
5. 关键机制与工程细节
| 层次 | 机制 | 解决的瓶颈 | 代价/适用条件 | 论文位置 |
|---|---|---|---|---|
| 算法 | Progressive group quantization | 把 FP 解量化改为 INT4→INT8,保留 group 精度 | 两级 scale;格式需专用 kernel | 第 5–6 页,式 3–4 |
| 算法 | Block rotation + MSE clipping | 抑制 activation outlier 与权重误差 | 需要校准与离线搜索 | 第 6、14 页;图 16 |
| 算法 | SmoothAttention | 缓解 KV4 的 K outlier | 依赖通道统计;Q 幅值增大但不缓存量化 | 第 7–8 页;图 10 |
| GEMM | Compute-aware weight reorder | 减少指针算术、提高 coalescing | 与 tile/warp 布局绑定 | 第 8–9 页;图 11–12 |
| GEMM | register-level parallelism | 隐藏 unpack/整数变换延迟 | 寄存器压力、架构相关 | 第 9 页 |
| Attention | KV4 fused kernel | 把 KV cache 减半转成带宽收益 | A100 上朴素实现会变慢 | 第 10 页;图 13–14 |
| Runtime | paged attention | 支持变长序列的 cache 管理 | 基准关闭 in-flight batching | 第 11–12 页,§6.1 |
6. 数据集、基准与指标
- WikiText2 perplexity:序列长度 2048,越低越好;覆盖 Llama-1/2/3、Mistral、Mixtral、Yi。它测语言建模拟合,不等价于聊天、代码、安全或长程事实一致性。
- 零样本任务:论文还用 LAMBADA、HellaSwag、PIQA、WinoGrande 等,表 3 报平均准确率;主结论仍以 perplexity 与吞吐为主。
- LongBench:v3 增加 Llama-3.1-8B-Instruct 的 10 个任务,平均分越高越好(表 5)。
- 服务吞吐:单 GPU、输入 1024 token、输出 512 token,报告最大 tokens/s;A100-80GB-SXM4 与 L40S-48GB。PyTorch 2.2.0、CUDA 12.2;TensorRT-LLM v0.9.0;基线代码截至 2024-04-18。paged attention 开启(QuaRot 不支持),in-flight batching 关闭(第 11–12 页)。该指标不是 SLO-constrained goodput,也没有 TTFT/TPOT 尾延迟。
7. 完整主结果矩阵
7.1 精度:WikiText2 perplexity
下表完整转录论文表 2 的十模型子矩阵。Atom 为 W4A4-g128
的非灰底(非 WikiText2 校准)行;AWQ/QoQ 为
W4A8KV4-g128。粗体为这些量化方法中的最低值;FP16
是参考上界,不参与“量化最优”标记。
| 方法 | L3-8B | L2-7B | L2-13B | L2-70B | L1-7B | L1-13B | L1-30B | Mistral-7B | Mixtral | Yi-34B |
|---|---|---|---|---|---|---|---|---|---|---|
| FP16 | 6.14 | 5.47 | 4.88 | 3.32 | 5.68 | 5.09 | 4.10 | 5.25 | 3.84 | 4.60 |
| SmoothQuant W8A8 | 6.28 | 5.54 | 4.95 | 3.36 | 5.73 | 5.13 | 4.23 | 5.29 | 3.89 | 4.69 |
| AWQ W4A16-g128 | 6.54 | 5.60 | 4.97 | 3.41 | 5.78 | 5.19 | 4.21 | 5.37 | 4.02 | 4.67 |
| Atom W4A4-g128 | 7.57 | 6.03 | 5.27 | 3.69 | 6.16 | 5.46 | 4.55 | 5.66 | 4.42 | 4.92 |
| AWQ W4A8KV4-g128 | 6.94 | 5.83 | 5.12 | 3.51 | 5.93 | 5.36 | 4.39 | 5.50 | 4.23 | 4.78 |
| QoQ W4A8KV4-g128 | 6.70 | 5.67 | 5.06 | 3.46 | 5.88 | 5.23 | 4.27 | 5.41 | 4.13 | 4.73 |
QoQ 相对同格式 AWQ 的绝对 perplexity 改善依次为 0.24、0.16、0.06、0.05、0.05、0.13、0.12、0.09、0.10、0.05;相对降幅分别约 3.46%、2.74%、1.17%、1.42%、0.84%、2.43%、2.73%、1.64%、2.36%、1.05%(本报告复算,来源均为表 2)。但 W8A8/W4A16 仍在多数模型更接近 FP16,所以不能说 QoQ“精度最佳”;它优化的是精度—显存—吞吐三方折中。
7.2 吞吐:L40S 与 A100
单位 tokens/s;每列 speedup 以三种 TensorRT-LLM 精度中的最高吞吐为分母(论文表 4)。
| L40S-48GB | L3-8B | L2-7B | Mistral | L2-13B | L1-30B | Yi-34B | L2-70B | Qwen72B |
|---|---|---|---|---|---|---|---|---|
| TRT FP16 | 1326 | 444 | 1566 | 92 | OOM | OOM | OOM | OOM |
| TRT W4A16 | 1431 | 681 | 1457 | 368 | 148 | 313 | 119 | 17 |
| TRT W8A8 | 2634 | 1271 | 2569 | 440 | 123 | 364 | OOM | OOM |
| QServe | 3656 | 2394 | 3774 | 1327 | 504 | 869 | 286 | 59 |
| 绝对增量 vs 最强 TRT | +1022 | +1123 | +1205 | +887 | +356 | +505 | +167 | +42 |
| 相对提升 | +39% | +88% | +47% | +202% | +241% | +139% | +140% | +247% |
| A100-80GB | L3-8B | L2-7B | Mistral | L2-13B | L1-30B | Yi-34B | L2-70B | Qwen72B |
|---|---|---|---|---|---|---|---|---|
| TRT FP16 | 2503 | 1549 | 2371 | 488 | 80 | 145 | OOM | OOM |
| TRT W4A16 | 2370 | 1549 | 2403 | 871 | 352 | 569 | 358 | 143 |
| TRT W8A8 | 2396 | 2334 | 2427 | 1277 | 361 | 649 | 234 | 53 |
| QServe | 3005 | 2908 | 2970 | 1741 | 749 | 797 | 419 | 340 |
| 绝对增量 vs 最强 TRT | +502 | +574 | +543 | +464 | +388 | +148 | +61 | +197 |
| 相对提升 | +20% | +25% | +22% | +36% | +107% | +23% | +17% | +138% |
最强单点是 L40S 上 Qwen1.5-72B:17→59 tokens/s,绝对 +42、相对 +247%(3.47×)。A100 对应 143→340,+197、+138%(2.38×)。论文正文把 A100 范围概括为 1.2–2.4×,表 4 的逐列值支持这一表述。跨卡比较方面,L40S+QServe 在 L3-8B、L2-7B、Mistral、L2-13B、L1-30B 五个模型上超过 A100+最佳 TRT;Yi-34B、70B、72B 不满足或缺少可比 A100 基线,故不能扩写成“所有模型”。
7.3 LongBench
论文表 5:Llama-3.1-8B-Instruct,QoQ W4A8KV4-g128。
| 方法 | DuReader | GovReport | HotpotQA | MultiNews | Musique | QMSum | SamSum | TriviaQA | TREC | MultiFieldQA-En | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| BF16 | 35.07 | 34.54 | 16.68 | 26.84 | 11.68 | 23.48 | 43.50 | 91.65 | 72.50 | 29.22 | 38.52 |
| QoQ | 35.45 | 34.09 | 17.46 | 26.73 | 12.05 | 23.45 | 44.42 | 91.45 | 71.00 | 27.65 | 38.38 |
平均仅下降 0.14 分(相对 -0.36%),且 4/10 任务上升;但这是单模型、单次评测,没有方差,不能把上升解释为量化带来的真实能力增益。
Qwen1.5-72B:容量与内核协同带来的吞吐差
同为最大可达吞吐;TensorRT-LLM 取三种精度中的最优。单位:tokens/s。
8. 逐层消融、敏感性与相变
图 16 在 Llama2-7B、L40S、64 请求、1024/512 token 上给出完整链条:W8A8KV8 baseline perplexity 5.58、吞吐 1367;换 W4 权重后为 6.00、1538(1.12×,省 3.5GB);block rotation 将 perplexity 降至 5.82,MSE clipping 再到 5.66;KV4 使 perplexity升到 5.80,但吞吐到 2254(1.47×,KV 内存减半);SmoothAttention 到 5.75;progressive group quantization 到 5.70、吞吐 2190;activation-aware reorder 最终 5.67。对照 Atom 为 6.12/1732,QuaRot 为 6.19/688。
这组消融说明收益不是单模块包办:精度修复来自 rotation、clipping、SmoothAttention 与 progressive group;速度主要来自 W4 容量和 KV4 带宽;最后的 group/reorder 以约 64 tokens/s(2.84%) 的吞吐回撤换 0.13 perplexity 改善(2254→2190、5.80→5.67,本报告复算)。
图 17 又把 batch capacity 与同 batch 内核速度分开:Llama2-7B 总加速 1.88× = 1.45×(同 batch)×约 1.30×(更大 batch);13B 总加速约 1.7×,两部分近似均分。图 19 的 KV4 kernel 逐层延迟为 0.48ms→0.44ms(bit tricks)→0.39ms(简化控制)→0.36ms(FP16 QK)→0.33ms(FP16 SV)→0.28ms(异步预取),累计 1.7×。
超参敏感性:论文讨论 SmoothAttention 的 (\alpha),指出 0.5 效果良好,并比较 per-channel 与 g128;但没有提供跨模型完整数表、置信区间或自动选参准则。因此能推出“存在硬件依赖的格式切换”:A100 用 per-channel,L40S 用 g128;不能推出 (\alpha=0.5) 在所有模型、层和长度全局最优。真正的“相变”来自 roofline:batch 增大使 W4A16 从带宽优势跨入解量化/计算瓶颈;KV4 若未优化,在 A100 也从省带宽跨为算力受限。
统计显著性:论文未报告吞吐多次运行的均值±标准差、尾延迟、perplexity 重复实验或显著性检验。因此 1.17× 等较小吞吐差值无法判断跨驱动版本/热状态是否稳定;38.52→38.38 也不能判断统计上是否等价,只能称“点估计接近”。
9. 相关工作:问题来源与技术来源链
SmoothQuant(ICML 2023)
论文解决 activation outlier 使 W8A8 难以无损的问题:通过逐通道等价缩放把 activation 的量化难度迁移到更易量化的权重,报告最高 1.56× 加速和约 2× 内存降低(其 PDF 第 1 页)。遗留缺口是仍停在 8 bit,KV cache 也不是其核心。QServe 继承“等价变换迁移量化难度”,但把接收端从权重改为不缓存的 Q,以 SmoothAttention 保护 K;设计传递是 outlier migration → K/Q 等价缩放。
AWQ(MLSys 2024)
论文识别约 1% salient weights 并以 activation-aware scaling 保护它们,解决 W4 weight-only 的精度与端侧速度,PDF 第 1 页报告相对 Hugging Face FP16 平均 3.2–3.3×。遗留缺口是 W4A16 仍需 FP16 Tensor Core 与在线权重解量化,面向高 batch 云服务时不一定占优。QServe 把 AWQ/clip 作为精度组件,但用 W4A8 与两级整数格式改变执行路径;传递是 salient-aware weight protection → block MSE clipping + progressive integer dequantization。
Atom(MLSys 2024)
arXiv面向吞吐服务,把 weight/activation/KV cache 都量化并保留少量 outlier channel;其 PDF 摘要报告相对 FP16 最高 7.73×。遗留缺口是 W4A4 group-wise activation 的 partial-sum 反量化进入 GEMM 主循环;QServe 图 18 测得这类 CUDA-core 开销最高约 90%,且 Atom 公开系统只支持部分模型。QServe 直接回应为 W4A8、保护区间与寄存器级 INT4→INT8;传递是 全链路低比特服务 → 避免在主循环做浮点 partial-sum dequant。
QuaRot(NeurIPS 2024)
OpenReview用 Hadamard rotation 消除隐藏态 outlier,实现权重、activation、KV cache 的端到端 4 bit。遗留缺口与 Atom 相似:准确率友好的 group quantization 未必映射为高 batch 吞吐,且论文对比时 QuaRot 不支持 paged attention。QServe保留旋转作为精度前处理,却选择 W4A8KV4 并优化服务 kernel;传递是 旋转消 outlier → 旋转不再等同于必须采用 W4A4 执行格式。
vLLM / PagedAttention 与 TensorRT-LLM
vLLM SOSP 2023解决 KV cache 碎片与共享,以分页管理提升服务吞吐;TensorRT-LLM提供产业级多精度内核。它们遗留的不是量化理论,而是特定 W4A8KV4 格式的端到端 kernel。QServe沿用 paged attention 与最大吞吐评测,把贡献放在格式—内核共设;但关闭 in-flight batching,使调度层优势尚未被完整检验。
┌─ SmoothQuant:等价缩放迁移 activation outlier ─┐
FP16 服务 ── W8A8 ──────┤ ├─ SmoothAttention:K→Q
│ └─ AWQ:activation-aware 保护 salient weights ──┤
│ ├─ QoQ W4A8KV4
├─ W4A16:省权重带宽 ── FP16 在线解量化瓶颈 ───────────────────────────┤
│ │
└─ W4A4 全链量化 ─┬─ Atom:group + outlier channel ─┐ │
└─ QuaRot:Hadamard 消 outlier ───┴─ partial-sum FP 解量化瓶颈
│
vLLM PagedAttention ── KV 分页/容量 ───────────────────────────────────────┤
TensorRT-LLM ── 工业基线/多精度 kernel ────────────────────────────────────┘
↓
QServe:格式 × GEMM × KV4 fused attention
转折并非 bit 数继续下降,而是评价目标从“模型文件/单 kernel 理论峰值”变成“服务关键路径中的低吞吐指令数”。这也是 QServe 最可复用的系统思想。
| 工作 | 权重/激活/KV | 主要精度手段 | 服务系统手段 | QServe 的回应 |
|---|---|---|---|---|
| SmoothQuant | W8A8 / KV未聚焦 | 等价缩放迁移 outlier | INT8 GEMM | 把迁移思想用于 K→Q |
| AWQ | W4A16 / KV未聚焦 | salient weight scaling | weight-only kernel | 保留保护,改 W4A8 执行 |
| Atom | W4A4KV4 | group + outlier channel | 全链低比特服务 | 避免 FP partial-sum dequant |
| QuaRot | W4A4KV4 | Hadamard rotation | 4-bit kernel | 旋转用于精度,执行仍 W4A8 |
| QServe | W4A8KV4 | QoQ + SmoothAttention | reorder、register、KV4 fused | 算法—系统闭环 |
10. 真正贡献、可复用设计与迁移潜力
第一,QServe把“非 Tensor Core 指令”提升为精度选择的一等约束。这个判断可迁移到 FP4、MXFP4、MoE、稀疏 kernel:比较格式时必须统计转换、索引、路由和同步,而不只看 MAC 位宽。
第二,progressive group quantization 展示了“中间表示为硬件服务”的设计:先用保护区间制造可并行、可溢出安全的 INT8 中间态,再二次压缩。它可以迁移到分块稀疏权重、专家权重流式加载和混合精度缓存。
第三,SmoothAttention 是较干净的结构不变变换:把缓存端 K 的 outlier 转移到即时 Q,不改变点积。其抽象是“把误差预算从长生命周期状态迁移到短生命周期计算”,可尝试用于跨注意力、视觉 token cache、RNN/SSM state quantization。
第四,图 17 把吞吐收益拆成同 batch kernel speed 与更大 batch capacity,这是系统论文应复用的归因模板;否则显存容纳更多请求与算子本身更快会被混成一个数字。
11. 限制与独立批判
论文自述/材料可见限制
- 硬件依赖:第 12–13 页明确 A100 与 L40S 使用不同量化粒度;Artifact Appendix 主要要求 x86_64,并推荐 A100/L40S。故结果不能直接外推到 Hopper/Blackwell、AMD 或移动端。
- 基线支持不齐:第 12 页说明 Atom/QuaRot 存在模型不支持,QuaRot 无 paged attention;表 4 因而无法为所有模型形成完全对称的六方法矩阵。
- 精度与配置边界:表 2 对部分方法/模型为 NaN,且灰底行使用 WikiText2 校准;这意味着校准数据可影响点估计,可比性需按行阅读。
独立批判(证据→推论)
- [评测外部效度] 因为吞吐只在固定 1024 输入/512 输出、in-flight batching 关闭的单一批量生成设置测量(§6.1),所以不能推出线上到达过程下的 TTFT、TPOT、P99 或 SLO goodput 更优。
- [基线时效] 因为 TensorRT-LLM 固定为 v0.9.0、其余主分支截至 2024-04-18(第 12 页),而论文终稿为 2025、当前核验为 2026,所以 1.17–3.47× 是历史快照,不能当作当前服务框架排行榜。
- [成本论证] 因为“L40S $8K、A100 $25K、成本省 3×”只在图 1 给出设备标价,未报告云厂商、采购时间、功耗、主机、利用率与折旧,所以能支持的是近似 GPU 采购价比,不能支持完整 TCO 或每个合格 token 的 3× 降本。
- [统计可信度] 因为全文没有吞吐重复次数、标准差或显著性检验,所以 A100 Llama2-70B 的 1.17× 等小优势可能受频率、温度、驱动和测量噪声影响;无法从点估计证明稳定领先。
- [归因公平性] 因为 QServe 相对 TRT 的总加速同时来自更大 batch capacity 与同 batch kernel(7B 为 1.88×=1.45××约1.30×,图 17),所以“量化内核快 1.88×”是错误推论;容量与 kernel 必须分别报告。
- [质量覆盖] 因为主要质量矩阵是 WikiText2 perplexity,LongBench 仅一个 8B 模型,且没有聊天偏好、代码、数学、安全、事实性与长对话压力测试,所以平均 38.52→38.38 不能证明所有部署任务“近乎无损”。
- [可移植性] 因为 weight reorder、寄存器并行和 KV4 bit tricks 与 A100/L40S 的 Tensor Core、CUDA core 与寄存器层次绑定,且朴素 KV4 在 A100 曾慢 1.2×,所以方法的算法收益不能脱离具体 kernel 与 GPU 世代复现。
- [比较完整性] 因为 Atom 仅支持 Llama2-7B、QuaRot 不支持 paged attention,表 4 只完整列 TRT 与 QServe,所以“优于全部 SOTA 系统”在多数模型上不是 head-to-head 实证,只能说优于可运行的报告基线。
12. 开放挑战:可操作的 head-to-head 实验空白
理论
- 格式选择模型:在同一模型与 GPU 上比较 W4A16、W8A8、W4A8KV4、W4A4KV4,逐 kernel 记录 Tensor Core 利用率、CUDA-core 指令、register spill、算术强度;检验一个含转换指令的扩展 roofline 能否预测 batch/长度转折点。
- 误差传播:固定权重 W4A8,仅比较 KV8、QoQ-KV4、QuaRot-KV4,在 1k/8k/32k/128k 长度上测 attention-logit KL、层间 state error 与任务分;确定 K/V 误差是否随长度线性或出现相变。
工程应用
- 线上 SLO:同一 A100/L40S/H100 上 QServe vs 最新 TensorRT-LLM/vLLM,使用 Poisson 与 bursty 到达,报告 TTFT/TPOT P50/P95/P99、99% SLO 下 goodput、能耗/token;而非只测最大 batch 吞吐。
- 公平版本复测:固定 2026 驱动、CUDA、编译器和调度器,将 QoQ kernel 接入同一 runtime,与 FP8/INT8/INT4 后端同场测;分离“runtime 年代差”与“格式贡献”。
- 多 GPU:70B/72B 在 1/2/4/8 GPU 上比较 tensor parallel、pipeline parallel 和 KV cache 通信;观察 KV4 节省是否被 all-reduce、反量化或负载不均衡抵消。
- TCO:A100/L40S/H100 按实际云价、功率、请求质量门槛测美元/百万合格输出 token;把论文的 3× 设备价格主张升级为可审计成本曲线。
新兴方向
- MoE W4A8KV4:QServe vs MoEQuant/FP8,在 Mixtral/DeepSeek 类模型上同时测专家权重流入、路由不均衡、KV4 attention 与跨卡通信,判断权重带宽还是专家通信成为新瓶颈。
- 推理时扩展:在相同答案正确率下比较 BF16、W8A8、QoQ 的并行采样数与 verifier 成本;如果量化小幅降低单样本质量但允许更多样本,评估最终 pass@k/美元是否改善。
- 多模态/世界模型:对 VLM 长视觉 token 与视频 KV cache 做 QServe vs KV8/FP8,报告视觉 grounding、时间一致性和吞吐;检验 SmoothAttention 的 K→Q 迁移是否跨模态成立。
13. 近期工作雷达(2025–2026)
- TurboAttention,MLSys 2025:用注意力近似与量化把 KV cache 缩小超过 4.4×,论文页报告 attention 1.2–1.8×;它是 QServe “精确 KV4 kernel”之外的近似路线,应在同质量阈值下比较。
- FlashInfer,MLSys 2025:把多种 KV 布局与注意力变体统一为可定制内核,是验证 QoQ 是否能进入更通用服务栈的自然底座。
- LServe,MLSys 2025:以统一稀疏注意力解决长序列 prefill 二次复杂度与 decode KV 容量;其与 QServe 已在 OmniServe 合流,代表“稀疏 × 低比特”的组合方向。
- LongRoPE2,ICML 2025:近无损扩展上下文窗口,却进一步放大 KV cache 压力;应与 QServe/LServe 联合评测,而非只看 needle retrieval。
- RWKVQuant,ICML 2025:把量化扩展到 RWKV 的 scalar/vector 混合表示;它提醒 QServe 的 KV-cache 中心叙事并不适用于所有序列架构。
- SkipGPT,ICML 2025:按 token 动态跳层,以减少计算而非降低每次计算位宽;与 QServe 组合时需要测动态控制流是否重新把瓶颈推回 CUDA cores。
- Cache Me If You Must,ICML 2025:按重要性自适应分配 KV 量化精度;与全量 KV4 相比,值得做“选择性保留高精 KV vs QoQ 全量 KV4”的质量—显存—内核复杂度对照。
14. 结论
QServe 的实证最强处是:在相同单卡内存预算下,W4A8KV4 将 Qwen1.5-72B 的 L40S 吞吐从最佳 TensorRT-LLM 的 17 提至 59 tokens/s(3.47×),且 A100 上也从 143 提至 340(2.38×)。更深的贡献是证明低 bit 的成败由关键路径上的 CUDA-core 指令决定:朴素 KV4 在 A100 会慢 1.2×,优化后才变成约 1.5× 加速。
但“3× 降本”应降格理解为特定设备标价下的示意,而非 TCO 结论;固定长度、关闭 in-flight batching、旧版 TensorRT-LLM、无尾延迟/标准差和单 GPU 范围,均限制了生产外推。真正值得复用的是它的研究方法:同时报告格式精度、容量带来的 batch 增益、同 batch kernel 增益,以及硬件转折点。
生成与验证脚注:报告已对核心
PDF、四篇技术来源论文和所有列出的 URL
做实际访问/读取;候选池保存在同目录的
candidates_2026-08-28.tsv。HTML 采用 Warm Editorial
单文件模板并做静态 HTML/CSS/JS 校验。运行环境未发现
/usr/bin/chromium 或 /opt/pw-browsers 的本机
Chromium,因此无法诚实完成 Playwright
的浅色、深色、移动端截图;已以响应式规则、横向表格容器、主题变量与 DOM
校验替代,未虚称完成浏览器渲染。ml-report-index.md
已追加本次记录。