一句话核心定位: LongLive 将因果视频扩散的长程问题拆成“训练时见过自身错误、推理时只保留局部窗口与首帧锚点、提示切换时重算缓存”三件事,使 1.3B 模型在单张 H100 上达到 20.7 FPS 并支持最长 240 秒生成;但其短视频 Semantic 仍低于 Self‑Forcing 4.81 分,最可靠的贡献是长程稳定—吞吐 Pareto,而非绝对画质全面领先。
1. 链接验证表与证据边界
以下 URL 均实际访问;数字来自实际读取的论文 v2 PDF。页码指 PDF
页序。LongLive 的 GitHub 在 2026 年更新为 2.0 主分支,1.0 代码在
v1.0 分支;本报告只分析论文对应的 LongLive 1.0。
| 工作 | 会议/正式页 | arXiv(具体版本与日期) | 代码 | 数据/权重 | 项目页/视频 |
|---|---|---|---|---|---|
| LongLive(核心) | ICLR 2026 OpenReview | 2509.22622v2,2025-10-13;v1 2025-09-26 | NVlabs/LongLive | LongLive-1.3B 权重;训练提示来自 VidProM | 项目页与视频 |
| Self-Forcing | NeurIPS 2025 Spotlight(见 arXiv comments) | 2506.08009v2,2025-11-10;v1 2025-06-09 | GitHub | 仓库链接模型权重 | 项目页 |
| SkyReels-V2 | 技术报告,未找到正式主会页 | 2504.13074v3,2025-04-21 | GitHub | 仓库提供多规格权重 | 仓库含 demo/playground |
| FramePack | OpenReview 页面未核实接收 venue | 2504.12626v3,2025-10-14 | GitHub | 仓库提供桌面模型与权重 | 项目页 |
| StreamingT2V | CVPR 2025 | 2403.14773v2,2025-04-16;v1 2024-03-21 | GitHub | 仓库/HF 提供权重 | 项目页 |
证据分级:表格精确值记为“论文原报”;百分比、倍数与差值只由这些值复算;图 7 没有给出全部窗口配置的小数,本报告只写“接近”和饱和点,不臆读柱高。论文没有报告多随机种子、标准差或置信区间,故不使用“显著提升”。
2. 排重、候选池与随机选择
先查 ml-report-index.md,排除近 14 天已覆盖的 DMFM
Alignment、Q-VDiT 与晶体扩散 KLDM。候选池共 24 篇,覆盖
ICLR/OpenReview、arXiv、公开项目页与代码:Transition Matching、Mean
Flows、Self Forcing、LongLive、TurboDiffusion、FLUX.1
Kontext、Qwen-Image、BAGEL、MAGI-1、UniWorld-V2、Representation
Autoencoders、Autoregressive Adversarial
Post-Training、Flow-GRPO、DanceGRPO、DiffusionNFT、SANA-Sprint、Block
Diffusion、SemanticGen、OmniGen2、OneReward、Goku、Graph Flow
Matching、Symmetrical Flow Matching、ZeroGVC。完整池见
candidates_2026-09-02.tsv。
执行 shuf -i 1-24 -n 1 得 4,即
LongLive。其 ICLR 2026 接收状态、v2 PDF、训练/推理代码、1.3B
权重和结果表均可核验,故 重抽 0
次。随机规则只决定核心论文,不以热度或主观喜好二次筛选。
3. Motivation:长视频不只是“把短片多生成几次”
短视频扩散通常使用双向时空注意力,画质高但无法自然复用历史 KV;因果 AR 模型可缓存,却会在滚动生成时不断条件化于自己的错误。LongLive 把矛盾概括为三组:短训练—长推理的 exposure bias;全历史注意力的二次计算与线性 KV 增长;提示切换时“删缓存会跳变、留缓存会粘住旧语义”。
量化痛点来自表 1(p.7):Wan2.1 仅 0.78 FPS、SkyReels-V2 0.49 FPS、MAGI-1 0.19 FPS;最快既有 CausVid/Self-Forcing chunk-wise 为 17.0 FPS。在 30 秒 VBench-Long 表 3(p.8)中,SkyReels-V2 总分 75.29,FramePack 81.95,Self-Forcing 81.59。这说明“无限长度”口号并未自动解决生成速度与长程一致性。
交互又增加状态更新问题:旧 prompt 经 cross-attention 写入 self-attention 的 KV cache;切换新 prompt 后,缓存仍携带旧语义。清空缓存能听新指令却破坏人物和场景,保留缓存能连续却出现 prompt inertia。LongLive 的工程目标不是一次性生成一条固定长片,而是用户可连续追加 prompt、系统持续输出且每步成本有界。
4. 故事线、核心假设与权衡
故事线有三个连续层次。第一,基于 Wan2.1-T2V-1.3B,把短片模型通过 Self-Forcing/DMD 适配成少步因果生成器。第二,训练不再只看真实短 clip,而是每轮延伸自身已生成历史 5 秒,只对当前新片段求梯度,让模型在训练时见到部署时的退化上下文。第三,训练与推理统一采用局部窗口加首帧 frame sink;提示切换时,以最近视觉历史和新 prompt 重建 KV。
其假设是:视频的大部分运动依赖近邻帧,首帧保留身份/场景的低频全局锚点;短片 teacher 虽不会生成可靠长片,却可逐段提供局部监督;detach 历史不会破坏学习长程稳定所需梯度;训练只含一次 prompt switch 仍可泛化到多次切换。权衡是:有界内存换来有限长程信息;首帧锚定可能妨碍应当发生的场景/身份变化;局部 teacher 继承了基座偏差。
5. 方程级形式化与伪代码
令每个 5 秒 latent chunk 为 (x_t),提示为 (p_t),历史缓存为 (C_t)。因果分解为 [ p_\theta(x_{1:T}|p_{1:T})=\prod_{t=1}^T p_\theta(x_t\mid C_{t-1},p_t), \quad C_t=\mathrm{Update}(C_{t-1},x_t,p_t). ] 普通 KV 保留在提示切换 (p^-\to p^+) 时使用 (C^-),旧语义残留;清空变为 (\varnothing),丢失视觉状态。KV-recache 定义为 [ C^+=G^{KV}\theta(x{t-W:t},p^+), ] 即用最近 (W) 帧和新提示重编码一次。论文报告单次 10 秒切换的 recache 只增加约 6% 时间(§3.1,p.3)。
流式长调优把历史 stop-gradient: [ \tilde x_{<t}\sim p_\theta,\quad \mathcal L_t=\mathcal L_{DMD}\bigl(x_t;\operatorname{sg}(\tilde x_{<t}),p_t,G_{teacher}\bigr), ] 所以反向图只覆盖当前 5 秒,不随总时长增长。驻留 KV 由局部窗口 (W)、当前监督片段 (T) 和 sink (S) 组成,空间为 (O(W+T+S)),不再是 (O(L))。
初始化:Wan2.1-1.3B → ODE init → Self-Forcing DMD 少步因果模型
for 每条最长 60s 训练 rollout:
cache = ∅
for chunk = 1..12:
若到随机 switch 点:cache = Recache(最近 W 帧, 新 prompt)
x_chunk = Student.sample(cache, active_prompt)
loss = DMD(x_chunk, Teacher14B, stopgrad(history))
只更新当前 chunk;cache 保留 [首帧 sink + 最近 W]
推理:每个 prompt 边界 recache 一次,其余持续滚动输出
6. 机制与工程细节
| 机制 | 具体设置 | 解决什么 | 成本/风险 | 来源 |
|---|---|---|---|---|
| 因果 AR 少步化 | Wan2.1-T2V-1.3B,832×480,5s/16FPS | 支持 KV cache 与流式输出 | 依赖 14B teacher 和 DMD | §4、附录 F,p.6/16 |
| Streaming long tuning | 每轮生成下一段 5s,最长 60s | train-long/test-long,见到自身错误 | 历史 detach,跨段梯度被截断 | §3.2,p.4 |
| KV-recache | 切换时用最近窗口+新 prompt 重建 cache | 连续性与新指令服从兼得 | 每次切换约 +6% 时间 | §3.1,p.3 |
| 短窗口 | local window 9 latent frames | 计算/缓存不随总时长增长 | 远程事件可能遗忘 | §3.3,p.5 |
| Frame sink | 首个 chunk 3 latent frames永久保留 | 身份/场景全局锚点 | 可能锁住初始状态 | 附录 F,p.16 |
| 提示数据 | VidProM 原 prompt;Qwen2-72B 生成后续 prompt | 无需额外真实长视频 | LLM 合成切换模式较规则 | §4、附录 E |
| 优化 | 64 H100,batch 64,3,000 iter;actor lr 1e-5,critic 2e-6;EMA .99 | 12h 完成长调优 | 约 32 H100 GPU-days | 附录 F,p.16 |
| LoRA | rank 32–512;rank256=350M 参数 | 降低状态开销 | 最优仍需 27% 参数 | 表 A,p.16 |
论文称窗口+sink 相比全历史在单 H100 上端到端计算时间降低 28%、峰值显存降低 17%(§3.3,p.5)。注意这不是相对所有 baseline,也不是 20.7 FPS 的完整来源分解。
7. 数据、基准与指标
短片用 VBench 官方 prompts,报告 Total、Quality、Semantic。单提示长片用 VBench-Long:每个 prompt 生成 30 秒并按官方脚本切片。交互评测是作者自建 160 条 60 秒视频,每条六个连续 10 秒 prompts;全程质量用 VBench-Long 可定制维度,语义对齐按 10 秒 segment 算 CLIP。用户研究有 48 个成对问题 × 26 个有效参与者 = 1,248 个判断(附录 L,p.17),但主文图 1 未给可直接复算的逐项数值表或置信区间。
FPS 均在单 H100(表 1/3),分辨率和参数量却并不完全统一:640×384 到 960×540,0.6B 到 4.5B。LongLive 20.7 FPS 对同为 1.3B/832×480 的 Self-Forcing 17.0 更可比;对 SkyReels 960×540 或 MAGI 4.5B 的倍数不能纯归因于算法。
8. 主结果完整矩阵
8.1 短视频 VBench(表 1,p.7)
| 方法 | 参数 | 分辨率 | FPS↑ | Total↑ | Quality↑ | Semantic↑ |
|---|---|---|---|---|---|---|
| LTX-Video | 1.9B | 768×512 | 8.98 | 80.00 | 82.30 | 70.79 |
| Wan2.1 | 1.3B | 832×480 | 0.78 | 84.26 | 85.30 | 80.09 |
| SkyReels-V2 | 1.3B | 960×540 | 0.49 | 82.67 | 84.70 | 74.53 |
| MAGI-1 | 4.5B | 832×480 | 0.19 | 79.18 | 82.04 | 67.74 |
| CausVid | 1.3B | 832×480 | 17.0 | 81.20 | 84.05 | 69.80 |
| NOVA | 0.6B | 768×480 | 0.88 | 80.12 | 80.39 | 79.05 |
| Pyramid Flow | 2B | 640×384 | 6.7 | 81.72 | 84.74 | 69.62 |
| Self-Forcing chunk | 1.3B | 832×480 | 17.0 | 84.31 | 85.07 | 81.28 |
| Self-Forcing frame | 1.3B | 832×480 | 8.9 | 84.26 | 85.25 | 80.30 |
| LongLive | 1.3B | 832×480 | 20.7 | 84.87 | 86.97 | 76.47 |
相对最可比的 Self-Forcing chunk,LongLive 吞吐 +3.7 FPS / +21.76%,Total +0.56 / +0.66%,Quality +1.90 / +2.23%,但 Semantic −4.81 / −5.92%(本报告复算)。相对 SkyReels-V2 为 42.24× FPS,但分辨率不同。
8.2 30 秒 VBench-Long(表 3,p.8)
| 方法 | Total↑ | Quality↑ | Semantic↑ | FPS↑ |
|---|---|---|---|---|
| SkyReels-V2 | 75.29 | 80.77 | 53.37 | 0.49 |
| FramePack | 81.95 | 83.61 | 75.32 | 0.92 |
| Self-Forcing | 81.59 | 83.82 | 72.70 | 17.0 |
| LongLive | 83.52 | 85.44 | 75.82 | 20.7 |
LongLive 对 Total 第二名 FramePack 为 +1.57 / +1.92%,对 Quality 第二名 Self-Forcing 为 +1.62 / +1.93%,对 Semantic 第二名 FramePack 为 +0.50 / +0.66%。这一表比短片表更支持方法主张。
8.3 60 秒交互(表 2,p.7)
| 方法 | Quality↑ | 0–10s CLIP | 10–20s | 20–30s | 30–40s | 40–50s | 50–60s |
|---|---|---|---|---|---|---|---|
| SkyReels-V2 | 80.49 | 20.96 | 22.51 | 25.78 | 18.45 | 19.57 | 19.61 |
| Self-Forcing | 82.46 | 28.46 | 24.89 | 23.53 | 22.96 | 23.07 | 23.19 |
| LongLive | 84.38 | 28.85 | 25.68 | 24.64 | 24.23 | 24.32 | 24.32 |
LongLive 全程 Quality 对 Self-Forcing +1.92 / +2.33%;末段 CLIP 为 24.32 对 23.19,+1.13 / +4.87%。但首段到末段仍从 28.85 降至 24.32,绝对 −4.53 / −15.70%,故“稳定”是相对更慢衰减,不是无衰减。
9. 逐层消融、超参相变与量化
KV 表 4(p.8):
| 缓存策略 | Background consistency↑ | Subject consistency↑ | CLIP↑ |
|---|---|---|---|
| No KV cache | 92.75 | 89.59 | 28.95 |
| KV cache | 94.77 | 93.69 | 25.92 |
| KV-recache | 94.81 | 94.04 | 27.87 |
Recache 相对普通 KV:背景 +0.04、主体 +0.35、CLIP +1.95(+7.52%);但相对清空缓存的 CLIP 仍低 1.08。它是折中 Pareto,不是每列最优。
图 7(p.8)只给趋势:窗口从 3 到 27 latent frames,一致性约在 24 帧饱和;9 local + 3 sink 接近 21-frame window。论文未给所有柱的精确数,不能造表。表 A(p.16)给 LoRA:rank 32/64/128/256/512/Full 的可训练参数 44M/87M/175M/350M/700M/1.3B,总分 81.08/82.68/82.98/83.12/83.04/83.52。rank 256 是 adapter 内最佳,512 反降 0.08,出现明确饱和;但 full 仍高 0.40。
表 B(p.16)在 RTX 5090:INT8/BF16 模型 1.4/2.7GB,FPS 16.4/12.6,Total 84.31/84.87,Quality 86.20/86.97,Semantic 76.74/76.47。INT8 吞吐 +30.16%,Total −0.56;Semantic 反而 +0.27,因无多种子不能把微小反向波动解释为量化增益。注意摘要/HF 后续称 FP8 24.8 FPS,而 v2 表 B 是 INT8 5090,硬件和精度口径不可混用。
10. 统计显著性与复现性
论文未报告生成随机种子数量、均值±标准差、bootstrap CI、VBench item-level 配对检验或用户研究置信区间;26 名参与者的重复判断也不是 1,248 个独立人。故 0.50 Semantic、0.04 Background 等差异无法判断统计稳定性。
可复现性优点是训练/推理代码、权重、提示生成模板和主要超参公开;要求至少
40GB GPU、Linux、64GB RAM。风险是主仓库已转为 LongLive 2.0,必须固定
v1.0 commit;训练依赖 Wan2.1-14B teacher、VidProM
prompts、Qwen2-72B 合成后续提示和 64 H100,完整复现门槛仍高。
11. 相关工作:问题来源与设计传递
StreamingT2V 解决短 clip 拼接的硬切,使用前一 chunk 的短期 CAM、第一 chunk 的长期 appearance preservation 与随机 blending,能生成 80–1,200+ 帧。缺口是多阶段模块推理慢、不是少步因果 KV 系统,也不处理流式 prompt 切换。LongLive 继承“近程+首段长期锚点”,把它压缩成 rolling window + frame sink。
SkyReels-V2 用 diffusion forcing、结构化电影 caption、多阶段训练与 motion RL 支持无限延伸。缺口是 1.3B 在 LongLive 表 1 仅 0.49 FPS,交互切换也需复杂状态处理。LongLive 保留 AR diffusion forcing 的长片路线,把重点从电影语言转为缓存和在线延迟。
FramePack 用按重要性压缩历史 frame context,使 Transformer context 固定,并用逆时间/端点等 anti-drift。缺口是其核心是上下文打包和 I2V 工作流,不提供 prompt switch recache。LongLive 对应地不学习复杂压缩,而保留“最近窗口+固定首帧”,设计更简单但信息容量更小。
Self-Forcing 是最直接技术来源:训练时自回归 rollout、用自身输出作上下文,并以 DMD/截断梯度消除 teacher-forcing gap。它留下的缺口是短训练向长 rollout 延伸仍退化,且无交互 prompt 更新。LongLive 将自迫式训练从短视频扩展为 60 秒 streaming long tuning,并把 KV-recache 嵌入同一训练条件。
短视频扩散
├─ StreamingT2V:前段锚点 + 局部过渡 ─────────┐
├─ SkyReels-V2:diffusion forcing + 电影后训练 ├─→ LongLive
├─ FramePack:固定历史预算 + anti-drift ──────┤ ├─ self-rollout 长调优
└─ Self-Forcing:训练时使用自身输出 ──────────┘ ├─ window + frame sink
└─ prompt 边界 KV-recache
尚未合流:动态检索历史 + 多事件因果记忆 + 等算力人评
| 工作 | 长程状态 | 训练—推理对齐 | 交互切换 | 成本随时长 | LongLive 如何回应/仍缺什么 |
|---|---|---|---|---|---|
| StreamingT2V | 首段+前块模块 | 有限 | 未主攻 | 多模块 | 简化为 cache;语义记忆弱 |
| SkyReels-V2 | diffusion forcing | 渐进训练 | 有限 | 较慢 | 20.7 vs 0.49 FPS;分辨率不等 |
| FramePack | 重要性压缩历史 | anti-drift | 无 recache | 固定 context | 更简单;无动态检索 |
| Self-Forcing | rolling KV | self-rollout | 未主攻 | 有界 | 延伸到 60s;teacher 依赖仍在 |
| LongLive | local 9 + sink 3 | streaming long tuning | KV-recache | (O(W+T+S)) | 远程事件与多镜头仍不足 |
12. 真正贡献、可复用设计与迁移潜力
真正贡献不是单一新 loss,而是三层一致性共同成立:训练用自身历史,训练与推理用同一窗口/sink,prompt switch 在训练和推理都执行 recache。单独抄 frame sink 未必有效;论文明确指出,当长 rollout collapse 先由 streaming tuning 缓解后,sink 才恢复作用(§3.3)。
可复用设计包括:流式 truncated backprop 让总序列长而显存恒定;事件边界显式 state refresh;稳定锚点与滑窗分工。这可迁移到 world model、机器人视觉 rollout、长音频生成、流式 avatar 和混合 linear/full attention。迁移时应把固定首帧改成可检索或可更新的 memory,否则真正换场景时锚点会成为错误约束。
13. 论文自述限制
- 基座上限。 附录 M(p.18)明确说方法是基座之上的高效微调,短片绝对质量不太可能持续超过基座;收益主要是适配与稳定。
- 继承偏差。 同一节指出不使用额外精选真实视频,无法修复基座系统性错误和偏见。
- 长程信息权衡。 §3.3(p.5)承认小窗口会损害一致性,约 24 帧才饱和;sink 只是折中,并非完整历史替代。
14. 独立批判:因为 X,所以 Y
- [语义代价] 因为短片 Semantic 76.47 低于 Self-Forcing 81.28 达 4.81 分(表 1),所以“短片能力不退化”只对 Total/Quality 成立,不能外推到文本遵循。
- [长程仍衰减] 因为交互 CLIP 从首段 28.85 降至末段 24.32(−15.70%),所以 LongLive 是减缓漂移而非消除漂移。
- [基线公平] 因为表 1 混合 0.6–4.5B、640×384–960×540,只有部分方法同为 1.3B/832×480,所以“全表最快”包含模型/分辨率差异。
- [指标有效性] 因为交互集由 Qwen2-72B 基于原 prompt 合成、要求只加一个动作并保持场景,而真实用户可能换主体、风格与镜头,所以 KV-recache 的泛化被较温和切换分布高估。
- [状态上限] 因为全局记忆只固定第一 chunk,局部只保留 9 帧,所以中途引入且稍后回归的角色/物体无长期槽位;240 秒 demo 不能证明事件级召回。
- [统计] 因为所有主表无标准差/CI,用户研究仅 26 人且重复测量,所以 0.50 分等小差距不能断言稳健。
- [归因] 因为系统同时引入 streaming tuning、短窗口、sink、recache,并先做 ODE+DMD 适配,而表格未给完整 factorial ablation,所以 20.7 FPS 与长程分数无法逐项归因。
- [“实时”定义] 因为 FPS 不包含首帧启动延迟、prompt 编码、VAE 解码/IO 的完整分解,也无 p95 抖动,所以 20.7 FPS 证明稳态吞吐,不等同于交互服务 SLA。
15. 可操作开放挑战
理论
- 锚点 vs 检索记忆: 固定 9+3 token 预算,比较首帧 sink、uniform sink、CLIP 相似检索、learned eviction;在“角色离场 30 秒后回归”集合测 identity retrieval 与每帧 FLOPs。
- 截断梯度偏差: 相同 60 秒序列比较 detach 历史、每 2/4 chunk 截断、低秩跨段梯度,报告质量、显存和梯度余弦,验证局部 DMD 是否错过长因果依赖。
- 切换分布相变: 控制 prompt edit distance,从单动作、换背景、换主体到风格突变,画 recache 一次/两次/不 recache 的 continuity—adherence Pareto。
工程应用
- 等硬件端到端: 在同一 H100、832×480、80 帧、相同 VAE 与编译设置下重跑 LongLive/Self-Forcing/SkyReels,报告 TTFF、稳态 FPS、p50/p95、峰值显存和功耗。
- 多用户服务: batch 1/2/4/8、不同切换频率下比较动态 batching 与 cache fragmentation;以每美元视频秒数和 SLA miss rate 为指标。
- 复现漂移: 固定公开 160 prompts 和 seeds,在不同 CUDA/GPU 上测试 60/240 秒分数及 hash 可重复性,量化 FramePack 所指出的硬件敏感。
新兴方向
- 视频 world model: 在相同控制轨迹上对比文本 prompt、键盘/6DoF action,测 controllability、状态一致性和闭环任务成功率,而非只测 VBench。
- 音视频同步长生成: 加入语音/环境声缓存,比较独立 audio sink 与共享 cross-modal memory,测嘴型、说话人和事件同步随 4 分钟的漂移。
- 安全编辑: 在 prompt 中途加入违规动作,比较 recache 前后安全策略生效延迟、旧语义残留和视觉连续性,检验缓存是否成为安全绕过通道。
16. 近期联读
- LongLive-2.0:把 1.0 的算法骨架升级为 NVFP4、sequence parallel 与异步 VAE 基础设施,报告 5B 模型 45.7 FPS;适合检验算法收益和硬件收益能否分离。
- LiveAnimate:用 pose-retrieval sink 在固定预算中取回历史姿态相关片段,比 LongLive 固定首帧更接近动态记忆。
- JoyAI-Echo-1.5:将跨镜头视觉记忆、说话人音频和 6DoF 控制合并,代表长视频向持久故事/world model 的迁移。
- MotionStream:把实时 AR 视频进一步扩展到细粒度运动控制,补足 LongLive 主要依赖粗文本 prompt 的限制。
- Self-Forcing:LongLive 最直接的训练来源,读它能区分“自生成历史监督”与 LongLive 新增的长调优/缓存更新。
- FramePack:从重要性压缩与 anti-drift 给出另一条固定上下文路线,适合做动态 memory head-to-head。
17. 结论
LongLive 的重要性在于把长视频生成从“一次昂贵采样”改写为有状态流式系统:状态要定期刷新、训练必须暴露于自身错误、全局与局部记忆必须分工。最关键结果是单 H100 20.7 FPS,30 秒 VBench-Long Total 83.52,同时短片 Semantic 比 Self-Forcing 低 4.81、末段 CLIP 仍较首段下降 15.70%。因此最准确的判断是:它建立了很强的长程质量—速度 Pareto,但没有解决语义衰减、动态长期记忆和服务级尾延迟。
脚注: 已更新 ml-report-index.md。HTML
使用 Warm Editorial
模板;全部精确数字来自实际读取论文表格/正文。当前环境未发现
/usr/bin/chromium、chromium-browser 或
/opt/pw-browsers 中可执行 Chromium,因此无法完成 Playwright
的浅色、深色与移动端截图检查;本报告不虚报该项,改以模板响应式规则和静态验证器(0
error / 0 warning)兜底。
同规格 1.3B / 832×480 模型的吞吐
LongLive 达到 20.7 FPS,相对 Self-Forcing chunk-wise 提升 21.76%;纵轴为单 H100 FPS。