ICLR 2026 · GENERATIVE VIDEO

LongLive:把长视频生成改造成可持续的流式系统

从自回归暴露偏差,到缓存刷新与长程状态管理

ICLR 2026 2026-09-02 实时交互式长视频生成

LongLive 以 streaming long tuning、frame sink 与 KV-recache 达到单 H100 20.7 FPS;真正优势是长程质量—速度 Pareto,而非短片语义全面领先。

一句话核心定位: LongLive 将因果视频扩散的长程问题拆成“训练时见过自身错误、推理时只保留局部窗口与首帧锚点、提示切换时重算缓存”三件事,使 1.3B 模型在单张 H100 上达到 20.7 FPS 并支持最长 240 秒生成;但其短视频 Semantic 仍低于 Self‑Forcing 4.81 分,最可靠的贡献是长程稳定—吞吐 Pareto,而非绝对画质全面领先。

1. 链接验证表与证据边界

以下 URL 均实际访问;数字来自实际读取的论文 v2 PDF。页码指 PDF 页序。LongLive 的 GitHub 在 2026 年更新为 2.0 主分支,1.0 代码在 v1.0 分支;本报告只分析论文对应的 LongLive 1.0。

工作 会议/正式页 arXiv(具体版本与日期) 代码 数据/权重 项目页/视频
LongLive(核心) ICLR 2026 OpenReview 2509.22622v2,2025-10-13;v1 2025-09-26 NVlabs/LongLive LongLive-1.3B 权重;训练提示来自 VidProM 项目页与视频
Self-Forcing NeurIPS 2025 Spotlight(见 arXiv comments) 2506.08009v2,2025-11-10;v1 2025-06-09 GitHub 仓库链接模型权重 项目页
SkyReels-V2 技术报告,未找到正式主会页 2504.13074v3,2025-04-21 GitHub 仓库提供多规格权重 仓库含 demo/playground
FramePack OpenReview 页面未核实接收 venue 2504.12626v3,2025-10-14 GitHub 仓库提供桌面模型与权重 项目页
StreamingT2V CVPR 2025 2403.14773v2,2025-04-16;v1 2024-03-21 GitHub 仓库/HF 提供权重 项目页

证据分级:表格精确值记为“论文原报”;百分比、倍数与差值只由这些值复算;图 7 没有给出全部窗口配置的小数,本报告只写“接近”和饱和点,不臆读柱高。论文没有报告多随机种子、标准差或置信区间,故不使用“显著提升”。

2. 排重、候选池与随机选择

先查 ml-report-index.md,排除近 14 天已覆盖的 DMFM Alignment、Q-VDiT 与晶体扩散 KLDM。候选池共 24 篇,覆盖 ICLR/OpenReview、arXiv、公开项目页与代码:Transition Matching、Mean Flows、Self Forcing、LongLive、TurboDiffusion、FLUX.1 Kontext、Qwen-Image、BAGEL、MAGI-1、UniWorld-V2、Representation Autoencoders、Autoregressive Adversarial Post-Training、Flow-GRPO、DanceGRPO、DiffusionNFT、SANA-Sprint、Block Diffusion、SemanticGen、OmniGen2、OneReward、Goku、Graph Flow Matching、Symmetrical Flow Matching、ZeroGVC。完整池见 candidates_2026-09-02.tsv

执行 shuf -i 1-24 -n 14,即 LongLive。其 ICLR 2026 接收状态、v2 PDF、训练/推理代码、1.3B 权重和结果表均可核验,故 重抽 0 次。随机规则只决定核心论文,不以热度或主观喜好二次筛选。

3. Motivation:长视频不只是“把短片多生成几次”

短视频扩散通常使用双向时空注意力,画质高但无法自然复用历史 KV;因果 AR 模型可缓存,却会在滚动生成时不断条件化于自己的错误。LongLive 把矛盾概括为三组:短训练—长推理的 exposure bias;全历史注意力的二次计算与线性 KV 增长;提示切换时“删缓存会跳变、留缓存会粘住旧语义”。

量化痛点来自表 1(p.7):Wan2.1 仅 0.78 FPS、SkyReels-V2 0.49 FPS、MAGI-1 0.19 FPS;最快既有 CausVid/Self-Forcing chunk-wise 为 17.0 FPS。在 30 秒 VBench-Long 表 3(p.8)中,SkyReels-V2 总分 75.29,FramePack 81.95,Self-Forcing 81.59。这说明“无限长度”口号并未自动解决生成速度与长程一致性。

交互又增加状态更新问题:旧 prompt 经 cross-attention 写入 self-attention 的 KV cache;切换新 prompt 后,缓存仍携带旧语义。清空缓存能听新指令却破坏人物和场景,保留缓存能连续却出现 prompt inertia。LongLive 的工程目标不是一次性生成一条固定长片,而是用户可连续追加 prompt、系统持续输出且每步成本有界。

4. 故事线、核心假设与权衡

故事线有三个连续层次。第一,基于 Wan2.1-T2V-1.3B,把短片模型通过 Self-Forcing/DMD 适配成少步因果生成器。第二,训练不再只看真实短 clip,而是每轮延伸自身已生成历史 5 秒,只对当前新片段求梯度,让模型在训练时见到部署时的退化上下文。第三,训练与推理统一采用局部窗口加首帧 frame sink;提示切换时,以最近视觉历史和新 prompt 重建 KV。

其假设是:视频的大部分运动依赖近邻帧,首帧保留身份/场景的低频全局锚点;短片 teacher 虽不会生成可靠长片,却可逐段提供局部监督;detach 历史不会破坏学习长程稳定所需梯度;训练只含一次 prompt switch 仍可泛化到多次切换。权衡是:有界内存换来有限长程信息;首帧锚定可能妨碍应当发生的场景/身份变化;局部 teacher 继承了基座偏差。

5. 方程级形式化与伪代码

令每个 5 秒 latent chunk 为 (x_t),提示为 (p_t),历史缓存为 (C_t)。因果分解为 [ p_\theta(x_{1:T}|p_{1:T})=\prod_{t=1}^T p_\theta(x_t\mid C_{t-1},p_t), \quad C_t=\mathrm{Update}(C_{t-1},x_t,p_t). ] 普通 KV 保留在提示切换 (p^-\to p^+) 时使用 (C^-),旧语义残留;清空变为 (\varnothing),丢失视觉状态。KV-recache 定义为 [ C^+=G^{KV}\theta(x{t-W:t},p^+), ] 即用最近 (W) 帧和新提示重编码一次。论文报告单次 10 秒切换的 recache 只增加约 6% 时间(§3.1,p.3)。

流式长调优把历史 stop-gradient: [ \tilde x_{<t}\sim p_\theta,\quad \mathcal L_t=\mathcal L_{DMD}\bigl(x_t;\operatorname{sg}(\tilde x_{<t}),p_t,G_{teacher}\bigr), ] 所以反向图只覆盖当前 5 秒,不随总时长增长。驻留 KV 由局部窗口 (W)、当前监督片段 (T) 和 sink (S) 组成,空间为 (O(W+T+S)),不再是 (O(L))。

初始化:Wan2.1-1.3B → ODE init → Self-Forcing DMD 少步因果模型
for 每条最长 60s 训练 rollout:
    cache = ∅
    for chunk = 1..12:
        若到随机 switch 点:cache = Recache(最近 W 帧, 新 prompt)
        x_chunk = Student.sample(cache, active_prompt)
        loss = DMD(x_chunk, Teacher14B, stopgrad(history))
        只更新当前 chunk;cache 保留 [首帧 sink + 最近 W]
推理:每个 prompt 边界 recache 一次,其余持续滚动输出

6. 机制与工程细节

机制 具体设置 解决什么 成本/风险 来源
因果 AR 少步化 Wan2.1-T2V-1.3B,832×480,5s/16FPS 支持 KV cache 与流式输出 依赖 14B teacher 和 DMD §4、附录 F,p.6/16
Streaming long tuning 每轮生成下一段 5s,最长 60s train-long/test-long,见到自身错误 历史 detach,跨段梯度被截断 §3.2,p.4
KV-recache 切换时用最近窗口+新 prompt 重建 cache 连续性与新指令服从兼得 每次切换约 +6% 时间 §3.1,p.3
短窗口 local window 9 latent frames 计算/缓存不随总时长增长 远程事件可能遗忘 §3.3,p.5
Frame sink 首个 chunk 3 latent frames永久保留 身份/场景全局锚点 可能锁住初始状态 附录 F,p.16
提示数据 VidProM 原 prompt;Qwen2-72B 生成后续 prompt 无需额外真实长视频 LLM 合成切换模式较规则 §4、附录 E
优化 64 H100,batch 64,3,000 iter;actor lr 1e-5,critic 2e-6;EMA .99 12h 完成长调优 约 32 H100 GPU-days 附录 F,p.16
LoRA rank 32–512;rank256=350M 参数 降低状态开销 最优仍需 27% 参数 表 A,p.16

论文称窗口+sink 相比全历史在单 H100 上端到端计算时间降低 28%、峰值显存降低 17%(§3.3,p.5)。注意这不是相对所有 baseline,也不是 20.7 FPS 的完整来源分解。

7. 数据、基准与指标

短片用 VBench 官方 prompts,报告 Total、Quality、Semantic。单提示长片用 VBench-Long:每个 prompt 生成 30 秒并按官方脚本切片。交互评测是作者自建 160 条 60 秒视频,每条六个连续 10 秒 prompts;全程质量用 VBench-Long 可定制维度,语义对齐按 10 秒 segment 算 CLIP。用户研究有 48 个成对问题 × 26 个有效参与者 = 1,248 个判断(附录 L,p.17),但主文图 1 未给可直接复算的逐项数值表或置信区间。

FPS 均在单 H100(表 1/3),分辨率和参数量却并不完全统一:640×384 到 960×540,0.6B 到 4.5B。LongLive 20.7 FPS 对同为 1.3B/832×480 的 Self-Forcing 17.0 更可比;对 SkyReels 960×540 或 MAGI 4.5B 的倍数不能纯归因于算法。

8. 主结果完整矩阵

8.1 短视频 VBench(表 1,p.7)

方法 参数 分辨率 FPS↑ Total↑ Quality↑ Semantic↑
LTX-Video 1.9B 768×512 8.98 80.00 82.30 70.79
Wan2.1 1.3B 832×480 0.78 84.26 85.30 80.09
SkyReels-V2 1.3B 960×540 0.49 82.67 84.70 74.53
MAGI-1 4.5B 832×480 0.19 79.18 82.04 67.74
CausVid 1.3B 832×480 17.0 81.20 84.05 69.80
NOVA 0.6B 768×480 0.88 80.12 80.39 79.05
Pyramid Flow 2B 640×384 6.7 81.72 84.74 69.62
Self-Forcing chunk 1.3B 832×480 17.0 84.31 85.07 81.28
Self-Forcing frame 1.3B 832×480 8.9 84.26 85.25 80.30
LongLive 1.3B 832×480 20.7 84.87 86.97 76.47

相对最可比的 Self-Forcing chunk,LongLive 吞吐 +3.7 FPS / +21.76%,Total +0.56 / +0.66%,Quality +1.90 / +2.23%,但 Semantic −4.81 / −5.92%(本报告复算)。相对 SkyReels-V2 为 42.24× FPS,但分辨率不同。

8.2 30 秒 VBench-Long(表 3,p.8)

方法 Total↑ Quality↑ Semantic↑ FPS↑
SkyReels-V2 75.29 80.77 53.37 0.49
FramePack 81.95 83.61 75.32 0.92
Self-Forcing 81.59 83.82 72.70 17.0
LongLive 83.52 85.44 75.82 20.7

LongLive 对 Total 第二名 FramePack 为 +1.57 / +1.92%,对 Quality 第二名 Self-Forcing 为 +1.62 / +1.93%,对 Semantic 第二名 FramePack 为 +0.50 / +0.66%。这一表比短片表更支持方法主张。

8.3 60 秒交互(表 2,p.7)

方法 Quality↑ 0–10s CLIP 10–20s 20–30s 30–40s 40–50s 50–60s
SkyReels-V2 80.49 20.96 22.51 25.78 18.45 19.57 19.61
Self-Forcing 82.46 28.46 24.89 23.53 22.96 23.07 23.19
LongLive 84.38 28.85 25.68 24.64 24.23 24.32 24.32

LongLive 全程 Quality 对 Self-Forcing +1.92 / +2.33%;末段 CLIP 为 24.32 对 23.19,+1.13 / +4.87%。但首段到末段仍从 28.85 降至 24.32,绝对 −4.53 / −15.70%,故“稳定”是相对更慢衰减,不是无衰减。

9. 逐层消融、超参相变与量化

KV 表 4(p.8):

缓存策略 Background consistency↑ Subject consistency↑ CLIP↑
No KV cache 92.75 89.59 28.95
KV cache 94.77 93.69 25.92
KV-recache 94.81 94.04 27.87

Recache 相对普通 KV:背景 +0.04、主体 +0.35、CLIP +1.95(+7.52%);但相对清空缓存的 CLIP 仍低 1.08。它是折中 Pareto,不是每列最优。

图 7(p.8)只给趋势:窗口从 3 到 27 latent frames,一致性约在 24 帧饱和;9 local + 3 sink 接近 21-frame window。论文未给所有柱的精确数,不能造表。表 A(p.16)给 LoRA:rank 32/64/128/256/512/Full 的可训练参数 44M/87M/175M/350M/700M/1.3B,总分 81.08/82.68/82.98/83.12/83.04/83.52。rank 256 是 adapter 内最佳,512 反降 0.08,出现明确饱和;但 full 仍高 0.40。

表 B(p.16)在 RTX 5090:INT8/BF16 模型 1.4/2.7GB,FPS 16.4/12.6,Total 84.31/84.87,Quality 86.20/86.97,Semantic 76.74/76.47。INT8 吞吐 +30.16%,Total −0.56;Semantic 反而 +0.27,因无多种子不能把微小反向波动解释为量化增益。注意摘要/HF 后续称 FP8 24.8 FPS,而 v2 表 B 是 INT8 5090,硬件和精度口径不可混用。

10. 统计显著性与复现性

论文未报告生成随机种子数量、均值±标准差、bootstrap CI、VBench item-level 配对检验或用户研究置信区间;26 名参与者的重复判断也不是 1,248 个独立人。故 0.50 Semantic、0.04 Background 等差异无法判断统计稳定性。

可复现性优点是训练/推理代码、权重、提示生成模板和主要超参公开;要求至少 40GB GPU、Linux、64GB RAM。风险是主仓库已转为 LongLive 2.0,必须固定 v1.0 commit;训练依赖 Wan2.1-14B teacher、VidProM prompts、Qwen2-72B 合成后续提示和 64 H100,完整复现门槛仍高。

11. 相关工作:问题来源与设计传递

StreamingT2V 解决短 clip 拼接的硬切,使用前一 chunk 的短期 CAM、第一 chunk 的长期 appearance preservation 与随机 blending,能生成 80–1,200+ 帧。缺口是多阶段模块推理慢、不是少步因果 KV 系统,也不处理流式 prompt 切换。LongLive 继承“近程+首段长期锚点”,把它压缩成 rolling window + frame sink。

SkyReels-V2 用 diffusion forcing、结构化电影 caption、多阶段训练与 motion RL 支持无限延伸。缺口是 1.3B 在 LongLive 表 1 仅 0.49 FPS,交互切换也需复杂状态处理。LongLive 保留 AR diffusion forcing 的长片路线,把重点从电影语言转为缓存和在线延迟。

FramePack 用按重要性压缩历史 frame context,使 Transformer context 固定,并用逆时间/端点等 anti-drift。缺口是其核心是上下文打包和 I2V 工作流,不提供 prompt switch recache。LongLive 对应地不学习复杂压缩,而保留“最近窗口+固定首帧”,设计更简单但信息容量更小。

Self-Forcing 是最直接技术来源:训练时自回归 rollout、用自身输出作上下文,并以 DMD/截断梯度消除 teacher-forcing gap。它留下的缺口是短训练向长 rollout 延伸仍退化,且无交互 prompt 更新。LongLive 将自迫式训练从短视频扩展为 60 秒 streaming long tuning,并把 KV-recache 嵌入同一训练条件。

短视频扩散
   ├─ StreamingT2V:前段锚点 + 局部过渡 ─────────┐
   ├─ SkyReels-V2:diffusion forcing + 电影后训练 ├─→ LongLive
   ├─ FramePack:固定历史预算 + anti-drift ──────┤    ├─ self-rollout 长调优
   └─ Self-Forcing:训练时使用自身输出 ──────────┘    ├─ window + frame sink
                                                       └─ prompt 边界 KV-recache
                         尚未合流:动态检索历史 + 多事件因果记忆 + 等算力人评
工作 长程状态 训练—推理对齐 交互切换 成本随时长 LongLive 如何回应/仍缺什么
StreamingT2V 首段+前块模块 有限 未主攻 多模块 简化为 cache;语义记忆弱
SkyReels-V2 diffusion forcing 渐进训练 有限 较慢 20.7 vs 0.49 FPS;分辨率不等
FramePack 重要性压缩历史 anti-drift 无 recache 固定 context 更简单;无动态检索
Self-Forcing rolling KV self-rollout 未主攻 有界 延伸到 60s;teacher 依赖仍在
LongLive local 9 + sink 3 streaming long tuning KV-recache (O(W+T+S)) 远程事件与多镜头仍不足

12. 真正贡献、可复用设计与迁移潜力

真正贡献不是单一新 loss,而是三层一致性共同成立:训练用自身历史,训练与推理用同一窗口/sink,prompt switch 在训练和推理都执行 recache。单独抄 frame sink 未必有效;论文明确指出,当长 rollout collapse 先由 streaming tuning 缓解后,sink 才恢复作用(§3.3)。

可复用设计包括:流式 truncated backprop 让总序列长而显存恒定;事件边界显式 state refresh;稳定锚点与滑窗分工。这可迁移到 world model、机器人视觉 rollout、长音频生成、流式 avatar 和混合 linear/full attention。迁移时应把固定首帧改成可检索或可更新的 memory,否则真正换场景时锚点会成为错误约束。

13. 论文自述限制

  1. 基座上限。 附录 M(p.18)明确说方法是基座之上的高效微调,短片绝对质量不太可能持续超过基座;收益主要是适配与稳定。
  2. 继承偏差。 同一节指出不使用额外精选真实视频,无法修复基座系统性错误和偏见。
  3. 长程信息权衡。 §3.3(p.5)承认小窗口会损害一致性,约 24 帧才饱和;sink 只是折中,并非完整历史替代。

14. 独立批判:因为 X,所以 Y

  1. [语义代价] 因为短片 Semantic 76.47 低于 Self-Forcing 81.28 达 4.81 分(表 1),所以“短片能力不退化”只对 Total/Quality 成立,不能外推到文本遵循。
  2. [长程仍衰减] 因为交互 CLIP 从首段 28.85 降至末段 24.32(−15.70%),所以 LongLive 是减缓漂移而非消除漂移。
  3. [基线公平] 因为表 1 混合 0.6–4.5B、640×384–960×540,只有部分方法同为 1.3B/832×480,所以“全表最快”包含模型/分辨率差异。
  4. [指标有效性] 因为交互集由 Qwen2-72B 基于原 prompt 合成、要求只加一个动作并保持场景,而真实用户可能换主体、风格与镜头,所以 KV-recache 的泛化被较温和切换分布高估。
  5. [状态上限] 因为全局记忆只固定第一 chunk,局部只保留 9 帧,所以中途引入且稍后回归的角色/物体无长期槽位;240 秒 demo 不能证明事件级召回。
  6. [统计] 因为所有主表无标准差/CI,用户研究仅 26 人且重复测量,所以 0.50 分等小差距不能断言稳健。
  7. [归因] 因为系统同时引入 streaming tuning、短窗口、sink、recache,并先做 ODE+DMD 适配,而表格未给完整 factorial ablation,所以 20.7 FPS 与长程分数无法逐项归因。
  8. [“实时”定义] 因为 FPS 不包含首帧启动延迟、prompt 编码、VAE 解码/IO 的完整分解,也无 p95 抖动,所以 20.7 FPS 证明稳态吞吐,不等同于交互服务 SLA。

15. 可操作开放挑战

理论

  • 锚点 vs 检索记忆: 固定 9+3 token 预算,比较首帧 sink、uniform sink、CLIP 相似检索、learned eviction;在“角色离场 30 秒后回归”集合测 identity retrieval 与每帧 FLOPs。
  • 截断梯度偏差: 相同 60 秒序列比较 detach 历史、每 2/4 chunk 截断、低秩跨段梯度,报告质量、显存和梯度余弦,验证局部 DMD 是否错过长因果依赖。
  • 切换分布相变: 控制 prompt edit distance,从单动作、换背景、换主体到风格突变,画 recache 一次/两次/不 recache 的 continuity—adherence Pareto。

工程应用

  • 等硬件端到端: 在同一 H100、832×480、80 帧、相同 VAE 与编译设置下重跑 LongLive/Self-Forcing/SkyReels,报告 TTFF、稳态 FPS、p50/p95、峰值显存和功耗。
  • 多用户服务: batch 1/2/4/8、不同切换频率下比较动态 batching 与 cache fragmentation;以每美元视频秒数和 SLA miss rate 为指标。
  • 复现漂移: 固定公开 160 prompts 和 seeds,在不同 CUDA/GPU 上测试 60/240 秒分数及 hash 可重复性,量化 FramePack 所指出的硬件敏感。

新兴方向

  • 视频 world model: 在相同控制轨迹上对比文本 prompt、键盘/6DoF action,测 controllability、状态一致性和闭环任务成功率,而非只测 VBench。
  • 音视频同步长生成: 加入语音/环境声缓存,比较独立 audio sink 与共享 cross-modal memory,测嘴型、说话人和事件同步随 4 分钟的漂移。
  • 安全编辑: 在 prompt 中途加入违规动作,比较 recache 前后安全策略生效延迟、旧语义残留和视觉连续性,检验缓存是否成为安全绕过通道。

16. 近期联读

  1. LongLive-2.0:把 1.0 的算法骨架升级为 NVFP4、sequence parallel 与异步 VAE 基础设施,报告 5B 模型 45.7 FPS;适合检验算法收益和硬件收益能否分离。
  2. LiveAnimate:用 pose-retrieval sink 在固定预算中取回历史姿态相关片段,比 LongLive 固定首帧更接近动态记忆。
  3. JoyAI-Echo-1.5:将跨镜头视觉记忆、说话人音频和 6DoF 控制合并,代表长视频向持久故事/world model 的迁移。
  4. MotionStream:把实时 AR 视频进一步扩展到细粒度运动控制,补足 LongLive 主要依赖粗文本 prompt 的限制。
  5. Self-Forcing:LongLive 最直接的训练来源,读它能区分“自生成历史监督”与 LongLive 新增的长调优/缓存更新。
  6. FramePack:从重要性压缩与 anti-drift 给出另一条固定上下文路线,适合做动态 memory head-to-head。

17. 结论

LongLive 的重要性在于把长视频生成从“一次昂贵采样”改写为有状态流式系统:状态要定期刷新、训练必须暴露于自身错误、全局与局部记忆必须分工。最关键结果是单 H100 20.7 FPS,30 秒 VBench-Long Total 83.52,同时短片 Semantic 比 Self-Forcing 低 4.81、末段 CLIP 仍较首段下降 15.70%。因此最准确的判断是:它建立了很强的长程质量—速度 Pareto,但没有解决语义衰减、动态长期记忆和服务级尾延迟。


脚注: 已更新 ml-report-index.md。HTML 使用 Warm Editorial 模板;全部精确数字来自实际读取论文表格/正文。当前环境未发现 /usr/bin/chromiumchromium-browser/opt/pw-browsers 中可执行 Chromium,因此无法完成 Playwright 的浅色、深色与移动端截图检查;本报告不虚报该项,改以模板响应式规则和静态验证器(0 error / 0 warning)兜底。

同规格 1.3B / 832×480 模型的吞吐

LongLive 达到 20.7 FPS,相对 Self-Forcing chunk-wise 提升 21.76%;纵轴为单 H100 FPS。

LongLive 与同规格基线吞吐比较Wan2.1 0.78,Self-Forcing frame 8.9,Self-Forcing chunk 17.0,LongLive 20.7 FPS。05101520Wan2.1SF frameSF chunkLongLive
来源:LongLive 表 1,p.7。只画相同参数量、分辨率与硬件口径,避免误导。