ML / AI DAILY DEEP PAPER · MLSys 2025

QServe:低比特不等于高吞吐

W4A8KV4 × GPU 内核协同:把解量化搬出关键路径

MLSys 2025 · arXiv v3 2026-08-28 效率与系统

QServe 在 L40S 上把 Qwen1.5-72B 吞吐从 17 提至 59 tokens/s,但固定负载、关闭 in-flight batching 与旧基线限制生产外推。

0. 链接验证表与证据口径

以下链接均在 2026-08-28 实际访问;数字只采用已下载并逐页读取的论文 PDF。网页用于身份、版本和资源可用性验证,不用二手页面补实验数字。

资源 已验证链接 状态与日期
MLSys 2025 论文页 Proceedings 已收录于第 8 届 MLSys,2025
arXiv 2405.04532 v1 2024-05-07;v2 2024-05-10;v3 2025-05-01
PDF arXiv v3 PDF 已下载并读取,15 页正文与附录
代码 OmniServe / QServe 已公开,Apache-2.0;README 说明 2025-02 统一 QServe/LServe
量化模型/权重 OmniServe model zoo 已公开多种 Llama/Mistral/Yi 模型;部分 70B/72B 链接或权重可用性需逐模型确认
基准数据 QServe-benchmarks 已公开;论文仍依赖 WikiText2、LongBench 等上游数据
项目页 MIT HAN Lab 已公开,含主要图与摘要
视频 未找到官方论文讲解视频 截至核验日未找到可归因于作者的正式视频

来源标记规则:表格中的“表 2/4/5”“图 16/17/19”均指 QServe v3 PDF;“本报告复算”只做除法、差值或几何含义解释,不从图中猜测未标出的精确数值。论文未报告重复试验、标准差、置信区间或显著性检验,本文不会补造。

1. 候选池、排重与随机选择

先审阅 ml-report-index.md,排除最近 14 天已深度覆盖的 DuoAttention、PARQ、Q-VDiT 及其近重复主题。候选来自 ICML/MLSys 2025 proceedings、arXiv、OpenReview、Hugging Face、Papers with Code 与 Semantic Scholar 的交叉检索,共 26 篇:

# 候选 方向/来源
1 Star Attention 长上下文稀疏注意力,arXiv 2024
2 Oscillation-Reduced MXFP4 Training 低精训练,ICML 2025
3 Dynamic Token Aggregation for DETR token 剪枝,ICML 2025
4 LongRoPE2 上下文扩展,ICML 2025
5 RWKVQuant 状态空间模型量化,ICML 2025
6 SkipGPT 动态层跳过,ICML 2025
7 Skrr 文生图编码器复用,ICML 2025
8 Targeted Low-rank Refinement 稀疏模型修复,ICML 2025
9 Randomized Subspace Optimization for LLMs 内存高效训练,ICML 2025
10 Olica 激活压缩,ICML 2025
11 Determining Layer-wise Sparsity 结构剪枝,ICML 2025
12 Ferret 联邦全参微调,ICML 2025
13 Cache Me If You Must KV cache/推理,ICML 2025
14 GANQ 生成式量化,ICML 2025
15 Pivoting Factorization 低秩压缩,ICML 2025
16 MoEQuant MoE 量化,ICML 2025
17 SepLLM 分段注意力,arXiv 2024
18 Core Context Aware Transformers 长上下文,arXiv 2025
19 QServe 量化—服务协同,MLSys 2025
20 TurboAttention KV/注意力压缩,MLSys 2025
21 FlashInfer 服务注意力引擎,MLSys 2025
22 Dynamic Input Pruning & Cache-Aware Masking 推理剪枝,2025
23 Mixture Compressor for MoE MoE 压缩,2025
24 Universal Model Routing 多模型路由,2025
25 MoE-Infinity MoE 服务,2025
26 DistServe prefill/decode 解耦,2024

在本地执行 shuf -i 1-26 -n 1 得到 19,故选择 QServe。没有重抽:论文、附录、代码、模型与基准材料充足,且“服务内核协同”与近期的训练量化 PARQ、视频量化 Q-VDiT 不构成主题重复。

2. Motivation:INT4 为什么可能越量化越慢

量化叙事通常从带宽和 Tensor Core 峰值出发:A100 的 FP16、INT8、INT4 Tensor Core 吞吐分别为 312、624、1248 TOPS,DRAM 带宽约 2 TB/s(论文第 4 页、图 3)。若只看这组数字,W4A4 应该比 W8A8 更快。然而 QServe 的起点是实测的 20%–90% 解量化开销(摘要与第 2 页):INT4 权重或 INT32 partial sum 必须在 CUDA cores 上做缩放、零点处理和类型转换;在 A100 上,一次 CUDA core 操作的代价可相当于约 50 次 INT4 Tensor Core 操作(第 2 页)。因此,主循环里几条“便宜的”标量指令,就可能让更快的矩阵乘单元等待。

论文给出两类失败模式:

  1. W4A16:权重存为 INT4,但 GEMM 用 FP16 Tensor Core,主循环要把权重反量化回 FP16;它适合小 batch 的 memory-bound 区域。roofline 分析显示 A100 上约在 batch 维度 m < 78 时 W4A16 有利,batch 再增大则计算与反量化成为瓶颈(第 4 页、图 3)。
  2. W4A4:为了精度常给 activation 做 group-wise 量化,INT32 partial sums 需在 K 维分组间多次缩放并转浮点。论文测得 Atom/QuaRot 类内核的解量化占比可到 90%(第 14 页、图 18)。

服务场景又让问题更尖锐:decode 的 KV cache 随序列长度和 batch 线性增长,attention 占端到端时间 30%–50%(第 10 页,§5.3)。权重 4 bit 却保留 KV8/16,只解决了一半内存墙;把 KV 直接压到 4 bit,又会因位操作和分支增加计算。论文实测,朴素 KV4 在 L40S 上相对 KV8 快 1.7×,但在 A100 上反而慢 1.2×(第 10 页)。这构成真正的系统问题:怎样让权重路径少用 CUDA core,同时让 KV4 attention 仍停留在 memory-bound 区域?

3. 故事线、假设与权衡

QServe 的故事线可以压成三个连续判断:

  • 判断 A:精度组合要服从服务 roofline。 W4A16 在小 batch 好,W8A8 在大 batch 好;所以选 W4A8,让权重带宽减半、矩阵乘走 INT8 Tensor Core。
  • 判断 B:算法格式必须让系统容易反量化。 QoQ 不是任意 W4A8,而是先做 per-channel INT8,再在 INT8 域做 group-wise INT4,使解量化可变成寄存器内整数乘减。
  • 判断 C:KV4 的收益需靠 attention 内核兑现。 SmoothAttention 负责精度,位技巧、控制流简化、FP16 QK/SV 与异步预取负责把算术强度压回带宽瓶颈。

它接受的权衡也很明确:W4A8KV4 并非最低算术位宽,理论 Tensor Core 峰值不如 W4A4;但它减少 CUDA-core 串行工作,以更高的“有效吞吐”换取较温和的精度损失。硬件相关性很强:论文在 A100 推荐 per-channel W4A8,在 CUDA core 更强的 L40S 推荐 g128 group quantization(第 12–13 页)。

4. 方程级形式化与流程

设权重块为 (W),第一阶段 per-channel 对称量化到保护区间 ([-119,119]):

[ s_c=\frac{\max |W_c|}{119},\qquad W^{(8)}_c=\operatorname{clip}!\left(\operatorname{round}(W_c/s_c),-119,119\right). ]

第二阶段按 group 做 4-bit 非对称量化:

[ q_{c,g}=\operatorname{clip}!\left(\operatorname{round}(W^{(8)}{c,g}/s{c,g})+z_{c,g},0,15\right), \quad \widehat W_{c,g}=s_c,s_{c,g}(q_{c,g}-z_{c,g}). ]

关键不是普通的二级量化外形,而是 [-119,119] 留出的溢出余量:QServe 可在寄存器中并行 unpack INT4,先乘整数 scale、再减预计算的 zero-point compensation,避免 GEMM 主循环里的 FP16 反量化(论文第 5–7 页,图 6–9)。

对注意力,标准计算为

[ O=\operatorname{softmax}(QK^\top/\sqrt d)V. ]

SmoothAttention 为每个通道引入缩放 (\lambda_j),令 (K'_j=K_j/\lambda_j, Q'_j=Q_j\lambda_j),于是 (Q'K'^\top=QK^\top) 保持不变。论文按通道统计 K 的幅值,并取平滑强度 (\alpha)(经验上 0.5 良好),把难量化的 K outlier 转移到无需缓存量化的 Q(第 7–8 页,式 5–7)。

流程伪代码:

输入:FP16 模型、校准样本、目标 GPU
1  对每个 block 搜索旋转/缩放与 clipping,使 block-output MSE 最小
2  权重先 per-channel -> INT8[-119,119],再 group -> UINT4
3  估计 K 通道幅值;用 SmoothAttention 把 K outlier 平移到 Q
4  按目标 GPU 选择 per-channel(A100) 或 g128(L40S)
5  离线重排 W4 pack,使相邻 Tensor Core 消费的数据减少地址计算
6  decode 时:W4 寄存器解包 -> INT8;W4A8 GEMM 在 INT8 Tensor Core 执行
7  KV4 fused attention:bit tricks -> 简化控制流 -> FP16 QK/SV -> async prefetch
输出:W4A8KV4 checkpoint 与最大吞吐服务引擎

5. 关键机制与工程细节

层次 机制 解决的瓶颈 代价/适用条件 论文位置
算法 Progressive group quantization 把 FP 解量化改为 INT4→INT8,保留 group 精度 两级 scale;格式需专用 kernel 第 5–6 页,式 3–4
算法 Block rotation + MSE clipping 抑制 activation outlier 与权重误差 需要校准与离线搜索 第 6、14 页;图 16
算法 SmoothAttention 缓解 KV4 的 K outlier 依赖通道统计;Q 幅值增大但不缓存量化 第 7–8 页;图 10
GEMM Compute-aware weight reorder 减少指针算术、提高 coalescing 与 tile/warp 布局绑定 第 8–9 页;图 11–12
GEMM register-level parallelism 隐藏 unpack/整数变换延迟 寄存器压力、架构相关 第 9 页
Attention KV4 fused kernel 把 KV cache 减半转成带宽收益 A100 上朴素实现会变慢 第 10 页;图 13–14
Runtime paged attention 支持变长序列的 cache 管理 基准关闭 in-flight batching 第 11–12 页,§6.1

6. 数据集、基准与指标

  • WikiText2 perplexity:序列长度 2048,越低越好;覆盖 Llama-1/2/3、Mistral、Mixtral、Yi。它测语言建模拟合,不等价于聊天、代码、安全或长程事实一致性。
  • 零样本任务:论文还用 LAMBADA、HellaSwag、PIQA、WinoGrande 等,表 3 报平均准确率;主结论仍以 perplexity 与吞吐为主。
  • LongBench:v3 增加 Llama-3.1-8B-Instruct 的 10 个任务,平均分越高越好(表 5)。
  • 服务吞吐:单 GPU、输入 1024 token、输出 512 token,报告最大 tokens/s;A100-80GB-SXM4 与 L40S-48GB。PyTorch 2.2.0、CUDA 12.2;TensorRT-LLM v0.9.0;基线代码截至 2024-04-18。paged attention 开启(QuaRot 不支持),in-flight batching 关闭(第 11–12 页)。该指标不是 SLO-constrained goodput,也没有 TTFT/TPOT 尾延迟。

7. 完整主结果矩阵

7.1 精度:WikiText2 perplexity

下表完整转录论文表 2 的十模型子矩阵。Atom 为 W4A4-g128 的非灰底(非 WikiText2 校准)行;AWQ/QoQ 为 W4A8KV4-g128。粗体为这些量化方法中的最低值;FP16 是参考上界,不参与“量化最优”标记。

方法 L3-8B L2-7B L2-13B L2-70B L1-7B L1-13B L1-30B Mistral-7B Mixtral Yi-34B
FP16 6.14 5.47 4.88 3.32 5.68 5.09 4.10 5.25 3.84 4.60
SmoothQuant W8A8 6.28 5.54 4.95 3.36 5.73 5.13 4.23 5.29 3.89 4.69
AWQ W4A16-g128 6.54 5.60 4.97 3.41 5.78 5.19 4.21 5.37 4.02 4.67
Atom W4A4-g128 7.57 6.03 5.27 3.69 6.16 5.46 4.55 5.66 4.42 4.92
AWQ W4A8KV4-g128 6.94 5.83 5.12 3.51 5.93 5.36 4.39 5.50 4.23 4.78
QoQ W4A8KV4-g128 6.70 5.67 5.06 3.46 5.88 5.23 4.27 5.41 4.13 4.73

QoQ 相对同格式 AWQ 的绝对 perplexity 改善依次为 0.24、0.16、0.06、0.05、0.05、0.13、0.12、0.09、0.10、0.05;相对降幅分别约 3.46%、2.74%、1.17%、1.42%、0.84%、2.43%、2.73%、1.64%、2.36%、1.05%(本报告复算,来源均为表 2)。但 W8A8/W4A16 仍在多数模型更接近 FP16,所以不能说 QoQ“精度最佳”;它优化的是精度—显存—吞吐三方折中。

7.2 吞吐:L40S 与 A100

单位 tokens/s;每列 speedup 以三种 TensorRT-LLM 精度中的最高吞吐为分母(论文表 4)。

L40S-48GB L3-8B L2-7B Mistral L2-13B L1-30B Yi-34B L2-70B Qwen72B
TRT FP16 1326 444 1566 92 OOM OOM OOM OOM
TRT W4A16 1431 681 1457 368 148 313 119 17
TRT W8A8 2634 1271 2569 440 123 364 OOM OOM
QServe 3656 2394 3774 1327 504 869 286 59
绝对增量 vs 最强 TRT +1022 +1123 +1205 +887 +356 +505 +167 +42
相对提升 +39% +88% +47% +202% +241% +139% +140% +247%
A100-80GB L3-8B L2-7B Mistral L2-13B L1-30B Yi-34B L2-70B Qwen72B
TRT FP16 2503 1549 2371 488 80 145 OOM OOM
TRT W4A16 2370 1549 2403 871 352 569 358 143
TRT W8A8 2396 2334 2427 1277 361 649 234 53
QServe 3005 2908 2970 1741 749 797 419 340
绝对增量 vs 最强 TRT +502 +574 +543 +464 +388 +148 +61 +197
相对提升 +20% +25% +22% +36% +107% +23% +17% +138%

最强单点是 L40S 上 Qwen1.5-72B:17→59 tokens/s,绝对 +42、相对 +247%(3.47×)。A100 对应 143→340,+197、+138%(2.38×)。论文正文把 A100 范围概括为 1.2–2.4×,表 4 的逐列值支持这一表述。跨卡比较方面,L40S+QServe 在 L3-8B、L2-7B、Mistral、L2-13B、L1-30B 五个模型上超过 A100+最佳 TRT;Yi-34B、70B、72B 不满足或缺少可比 A100 基线,故不能扩写成“所有模型”。

7.3 LongBench

论文表 5:Llama-3.1-8B-Instruct,QoQ W4A8KV4-g128。

方法 DuReader GovReport HotpotQA MultiNews Musique QMSum SamSum TriviaQA TREC MultiFieldQA-En 平均
BF16 35.07 34.54 16.68 26.84 11.68 23.48 43.50 91.65 72.50 29.22 38.52
QoQ 35.45 34.09 17.46 26.73 12.05 23.45 44.42 91.45 71.00 27.65 38.38

平均仅下降 0.14 分(相对 -0.36%),且 4/10 任务上升;但这是单模型、单次评测,没有方差,不能把上升解释为量化带来的真实能力增益。

Qwen1.5-72B:容量与内核协同带来的吞吐差

同为最大可达吞吐;TensorRT-LLM 取三种精度中的最优。单位:tokens/s。

Qwen1.5-72B 在 L40S 与 A100 上的吞吐L40S TensorRT 17、QServe 59;A100 TensorRT 143、QServe 340 tokens per second。 0170340 L40S TRT17L40S QServe59A100 TRT143A100 QServe340
来源:QServe 表 4(p. 13)。悬停或键盘聚焦柱形可查看数值。

8. 逐层消融、敏感性与相变

图 16 在 Llama2-7B、L40S、64 请求、1024/512 token 上给出完整链条:W8A8KV8 baseline perplexity 5.58、吞吐 1367;换 W4 权重后为 6.00、1538(1.12×,省 3.5GB);block rotation 将 perplexity 降至 5.82,MSE clipping 再到 5.66;KV4 使 perplexity升到 5.80,但吞吐到 2254(1.47×,KV 内存减半);SmoothAttention 到 5.75;progressive group quantization 到 5.70、吞吐 2190;activation-aware reorder 最终 5.67。对照 Atom 为 6.12/1732,QuaRot 为 6.19/688。

这组消融说明收益不是单模块包办:精度修复来自 rotation、clipping、SmoothAttention 与 progressive group;速度主要来自 W4 容量和 KV4 带宽;最后的 group/reorder 以约 64 tokens/s(2.84%) 的吞吐回撤换 0.13 perplexity 改善(2254→2190、5.80→5.67,本报告复算)。

图 17 又把 batch capacity 与同 batch 内核速度分开:Llama2-7B 总加速 1.88× = 1.45×(同 batch)×约 1.30×(更大 batch);13B 总加速约 1.7×,两部分近似均分。图 19 的 KV4 kernel 逐层延迟为 0.48ms→0.44ms(bit tricks)→0.39ms(简化控制)→0.36ms(FP16 QK)→0.33ms(FP16 SV)→0.28ms(异步预取),累计 1.7×

超参敏感性:论文讨论 SmoothAttention 的 (\alpha),指出 0.5 效果良好,并比较 per-channel 与 g128;但没有提供跨模型完整数表、置信区间或自动选参准则。因此能推出“存在硬件依赖的格式切换”:A100 用 per-channel,L40S 用 g128;不能推出 (\alpha=0.5) 在所有模型、层和长度全局最优。真正的“相变”来自 roofline:batch 增大使 W4A16 从带宽优势跨入解量化/计算瓶颈;KV4 若未优化,在 A100 也从省带宽跨为算力受限。

统计显著性:论文未报告吞吐多次运行的均值±标准差、尾延迟、perplexity 重复实验或显著性检验。因此 1.17× 等较小吞吐差值无法判断跨驱动版本/热状态是否稳定;38.52→38.38 也不能判断统计上是否等价,只能称“点估计接近”。

9. 相关工作:问题来源与技术来源链

SmoothQuant(ICML 2023)

论文解决 activation outlier 使 W8A8 难以无损的问题:通过逐通道等价缩放把 activation 的量化难度迁移到更易量化的权重,报告最高 1.56× 加速和约 2× 内存降低(其 PDF 第 1 页)。遗留缺口是仍停在 8 bit,KV cache 也不是其核心。QServe 继承“等价变换迁移量化难度”,但把接收端从权重改为不缓存的 Q,以 SmoothAttention 保护 K;设计传递是 outlier migration → K/Q 等价缩放

AWQ(MLSys 2024)

论文识别约 1% salient weights 并以 activation-aware scaling 保护它们,解决 W4 weight-only 的精度与端侧速度,PDF 第 1 页报告相对 Hugging Face FP16 平均 3.2–3.3×。遗留缺口是 W4A16 仍需 FP16 Tensor Core 与在线权重解量化,面向高 batch 云服务时不一定占优。QServe 把 AWQ/clip 作为精度组件,但用 W4A8 与两级整数格式改变执行路径;传递是 salient-aware weight protection → block MSE clipping + progressive integer dequantization

Atom(MLSys 2024)

arXiv面向吞吐服务,把 weight/activation/KV cache 都量化并保留少量 outlier channel;其 PDF 摘要报告相对 FP16 最高 7.73×。遗留缺口是 W4A4 group-wise activation 的 partial-sum 反量化进入 GEMM 主循环;QServe 图 18 测得这类 CUDA-core 开销最高约 90%,且 Atom 公开系统只支持部分模型。QServe 直接回应为 W4A8、保护区间与寄存器级 INT4→INT8;传递是 全链路低比特服务 → 避免在主循环做浮点 partial-sum dequant

QuaRot(NeurIPS 2024)

OpenReview用 Hadamard rotation 消除隐藏态 outlier,实现权重、activation、KV cache 的端到端 4 bit。遗留缺口与 Atom 相似:准确率友好的 group quantization 未必映射为高 batch 吞吐,且论文对比时 QuaRot 不支持 paged attention。QServe保留旋转作为精度前处理,却选择 W4A8KV4 并优化服务 kernel;传递是 旋转消 outlier → 旋转不再等同于必须采用 W4A4 执行格式

vLLM / PagedAttention 与 TensorRT-LLM

vLLM SOSP 2023解决 KV cache 碎片与共享,以分页管理提升服务吞吐;TensorRT-LLM提供产业级多精度内核。它们遗留的不是量化理论,而是特定 W4A8KV4 格式的端到端 kernel。QServe沿用 paged attention 与最大吞吐评测,把贡献放在格式—内核共设;但关闭 in-flight batching,使调度层优势尚未被完整检验。

                         ┌─ SmoothQuant:等价缩放迁移 activation outlier ─┐
FP16 服务 ── W8A8 ──────┤                                               ├─ SmoothAttention:K→Q
   │                     └─ AWQ:activation-aware 保护 salient weights ──┤
   │                                                                     ├─ QoQ W4A8KV4
   ├─ W4A16:省权重带宽 ── FP16 在线解量化瓶颈 ───────────────────────────┤
   │                                                                     │
   └─ W4A4 全链量化 ─┬─ Atom:group + outlier channel ─┐                 │
                     └─ QuaRot:Hadamard 消 outlier ───┴─ partial-sum FP 解量化瓶颈
                                                                          │
vLLM PagedAttention ── KV 分页/容量 ───────────────────────────────────────┤
TensorRT-LLM ── 工业基线/多精度 kernel ────────────────────────────────────┘
                                      ↓
                         QServe:格式 × GEMM × KV4 fused attention

转折并非 bit 数继续下降,而是评价目标从“模型文件/单 kernel 理论峰值”变成“服务关键路径中的低吞吐指令数”。这也是 QServe 最可复用的系统思想。

工作 权重/激活/KV 主要精度手段 服务系统手段 QServe 的回应
SmoothQuant W8A8 / KV未聚焦 等价缩放迁移 outlier INT8 GEMM 把迁移思想用于 K→Q
AWQ W4A16 / KV未聚焦 salient weight scaling weight-only kernel 保留保护,改 W4A8 执行
Atom W4A4KV4 group + outlier channel 全链低比特服务 避免 FP partial-sum dequant
QuaRot W4A4KV4 Hadamard rotation 4-bit kernel 旋转用于精度,执行仍 W4A8
QServe W4A8KV4 QoQ + SmoothAttention reorder、register、KV4 fused 算法—系统闭环

10. 真正贡献、可复用设计与迁移潜力

第一,QServe把“非 Tensor Core 指令”提升为精度选择的一等约束。这个判断可迁移到 FP4、MXFP4、MoE、稀疏 kernel:比较格式时必须统计转换、索引、路由和同步,而不只看 MAC 位宽。

第二,progressive group quantization 展示了“中间表示为硬件服务”的设计:先用保护区间制造可并行、可溢出安全的 INT8 中间态,再二次压缩。它可以迁移到分块稀疏权重、专家权重流式加载和混合精度缓存。

第三,SmoothAttention 是较干净的结构不变变换:把缓存端 K 的 outlier 转移到即时 Q,不改变点积。其抽象是“把误差预算从长生命周期状态迁移到短生命周期计算”,可尝试用于跨注意力、视觉 token cache、RNN/SSM state quantization。

第四,图 17 把吞吐收益拆成同 batch kernel speed 与更大 batch capacity,这是系统论文应复用的归因模板;否则显存容纳更多请求与算子本身更快会被混成一个数字。

11. 限制与独立批判

论文自述/材料可见限制

  1. 硬件依赖:第 12–13 页明确 A100 与 L40S 使用不同量化粒度;Artifact Appendix 主要要求 x86_64,并推荐 A100/L40S。故结果不能直接外推到 Hopper/Blackwell、AMD 或移动端。
  2. 基线支持不齐:第 12 页说明 Atom/QuaRot 存在模型不支持,QuaRot 无 paged attention;表 4 因而无法为所有模型形成完全对称的六方法矩阵。
  3. 精度与配置边界:表 2 对部分方法/模型为 NaN,且灰底行使用 WikiText2 校准;这意味着校准数据可影响点估计,可比性需按行阅读。

独立批判(证据→推论)

  1. [评测外部效度] 因为吞吐只在固定 1024 输入/512 输出、in-flight batching 关闭的单一批量生成设置测量(§6.1),所以不能推出线上到达过程下的 TTFT、TPOT、P99 或 SLO goodput 更优。
  2. [基线时效] 因为 TensorRT-LLM 固定为 v0.9.0、其余主分支截至 2024-04-18(第 12 页),而论文终稿为 2025、当前核验为 2026,所以 1.17–3.47× 是历史快照,不能当作当前服务框架排行榜。
  3. [成本论证] 因为“L40S $8K、A100 $25K、成本省 3×”只在图 1 给出设备标价,未报告云厂商、采购时间、功耗、主机、利用率与折旧,所以能支持的是近似 GPU 采购价比,不能支持完整 TCO 或每个合格 token 的 3× 降本。
  4. [统计可信度] 因为全文没有吞吐重复次数、标准差或显著性检验,所以 A100 Llama2-70B 的 1.17× 等小优势可能受频率、温度、驱动和测量噪声影响;无法从点估计证明稳定领先。
  5. [归因公平性] 因为 QServe 相对 TRT 的总加速同时来自更大 batch capacity 与同 batch kernel(7B 为 1.88×=1.45××约1.30×,图 17),所以“量化内核快 1.88×”是错误推论;容量与 kernel 必须分别报告。
  6. [质量覆盖] 因为主要质量矩阵是 WikiText2 perplexity,LongBench 仅一个 8B 模型,且没有聊天偏好、代码、数学、安全、事实性与长对话压力测试,所以平均 38.52→38.38 不能证明所有部署任务“近乎无损”。
  7. [可移植性] 因为 weight reorder、寄存器并行和 KV4 bit tricks 与 A100/L40S 的 Tensor Core、CUDA core 与寄存器层次绑定,且朴素 KV4 在 A100 曾慢 1.2×,所以方法的算法收益不能脱离具体 kernel 与 GPU 世代复现。
  8. [比较完整性] 因为 Atom 仅支持 Llama2-7B、QuaRot 不支持 paged attention,表 4 只完整列 TRT 与 QServe,所以“优于全部 SOTA 系统”在多数模型上不是 head-to-head 实证,只能说优于可运行的报告基线。

12. 开放挑战:可操作的 head-to-head 实验空白

理论

  • 格式选择模型:在同一模型与 GPU 上比较 W4A16、W8A8、W4A8KV4、W4A4KV4,逐 kernel 记录 Tensor Core 利用率、CUDA-core 指令、register spill、算术强度;检验一个含转换指令的扩展 roofline 能否预测 batch/长度转折点。
  • 误差传播:固定权重 W4A8,仅比较 KV8、QoQ-KV4、QuaRot-KV4,在 1k/8k/32k/128k 长度上测 attention-logit KL、层间 state error 与任务分;确定 K/V 误差是否随长度线性或出现相变。

工程应用

  • 线上 SLO:同一 A100/L40S/H100 上 QServe vs 最新 TensorRT-LLM/vLLM,使用 Poisson 与 bursty 到达,报告 TTFT/TPOT P50/P95/P99、99% SLO 下 goodput、能耗/token;而非只测最大 batch 吞吐。
  • 公平版本复测:固定 2026 驱动、CUDA、编译器和调度器,将 QoQ kernel 接入同一 runtime,与 FP8/INT8/INT4 后端同场测;分离“runtime 年代差”与“格式贡献”。
  • 多 GPU:70B/72B 在 1/2/4/8 GPU 上比较 tensor parallel、pipeline parallel 和 KV cache 通信;观察 KV4 节省是否被 all-reduce、反量化或负载不均衡抵消。
  • TCO:A100/L40S/H100 按实际云价、功率、请求质量门槛测美元/百万合格输出 token;把论文的 3× 设备价格主张升级为可审计成本曲线。

新兴方向

  • MoE W4A8KV4:QServe vs MoEQuant/FP8,在 Mixtral/DeepSeek 类模型上同时测专家权重流入、路由不均衡、KV4 attention 与跨卡通信,判断权重带宽还是专家通信成为新瓶颈。
  • 推理时扩展:在相同答案正确率下比较 BF16、W8A8、QoQ 的并行采样数与 verifier 成本;如果量化小幅降低单样本质量但允许更多样本,评估最终 pass@k/美元是否改善。
  • 多模态/世界模型:对 VLM 长视觉 token 与视频 KV cache 做 QServe vs KV8/FP8,报告视觉 grounding、时间一致性和吞吐;检验 SmoothAttention 的 K→Q 迁移是否跨模态成立。

13. 近期工作雷达(2025–2026)

  1. TurboAttention,MLSys 2025:用注意力近似与量化把 KV cache 缩小超过 4.4×,论文页报告 attention 1.2–1.8×;它是 QServe “精确 KV4 kernel”之外的近似路线,应在同质量阈值下比较。
  2. FlashInfer,MLSys 2025:把多种 KV 布局与注意力变体统一为可定制内核,是验证 QoQ 是否能进入更通用服务栈的自然底座。
  3. LServe,MLSys 2025:以统一稀疏注意力解决长序列 prefill 二次复杂度与 decode KV 容量;其与 QServe 已在 OmniServe 合流,代表“稀疏 × 低比特”的组合方向。
  4. LongRoPE2,ICML 2025:近无损扩展上下文窗口,却进一步放大 KV cache 压力;应与 QServe/LServe 联合评测,而非只看 needle retrieval。
  5. RWKVQuant,ICML 2025:把量化扩展到 RWKV 的 scalar/vector 混合表示;它提醒 QServe 的 KV-cache 中心叙事并不适用于所有序列架构。
  6. SkipGPT,ICML 2025:按 token 动态跳层,以减少计算而非降低每次计算位宽;与 QServe 组合时需要测动态控制流是否重新把瓶颈推回 CUDA cores。
  7. Cache Me If You Must,ICML 2025:按重要性自适应分配 KV 量化精度;与全量 KV4 相比,值得做“选择性保留高精 KV vs QoQ 全量 KV4”的质量—显存—内核复杂度对照。

14. 结论

QServe 的实证最强处是:在相同单卡内存预算下,W4A8KV4 将 Qwen1.5-72B 的 L40S 吞吐从最佳 TensorRT-LLM 的 17 提至 59 tokens/s(3.47×),且 A100 上也从 143 提至 340(2.38×)。更深的贡献是证明低 bit 的成败由关键路径上的 CUDA-core 指令决定:朴素 KV4 在 A100 会慢 1.2×,优化后才变成约 1.5× 加速。

但“3× 降本”应降格理解为特定设备标价下的示意,而非 TCO 结论;固定长度、关闭 in-flight batching、旧版 TensorRT-LLM、无尾延迟/标准差和单 GPU 范围,均限制了生产外推。真正值得复用的是它的研究方法:同时报告格式精度、容量带来的 batch 增益、同 batch kernel 增益,以及硬件转折点


生成与验证脚注:报告已对核心 PDF、四篇技术来源论文和所有列出的 URL 做实际访问/读取;候选池保存在同目录的 candidates_2026-08-28.tsv。HTML 采用 Warm Editorial 单文件模板并做静态 HTML/CSS/JS 校验。运行环境未发现 /usr/bin/chromium/opt/pw-browsers 的本机 Chromium,因此无法诚实完成 Playwright 的浅色、深色、移动端截图;已以响应式规则、横向表格容器、主题变量与 DOM 校验替代,未虚称完成浏览器渲染。ml-report-index.md 已追加本次记录。