ECCV 2026 · 长视频理解 · 视觉与多模态
ML/AI 每日深度论文追踪 · 2026-08-11(周二)· 领域轮转:视觉与多模态
一句话定位:压缩不再是接在视觉编码器后面的一个无状态模块,而是一个会读用户问题、能自己判断「这段该看几眼」的小型 VLM——并且它顺手输出的相关性打分,直接成了全局 token 预算的分配依据。
| 项目 | 内容 |
|---|---|
| 日期 | 2026-08-11(周二,date +%u = 2) |
| 轮转领域 | 视觉与多模态(检测分割 / VLM / 视频理解 / 表示学习) |
| 候选池规模 | 24 篇(CVPR 2026 Highlights 实测抓取 63 篇后,剔除生成模型类(属周三领域)与非视觉类,补入 3 篇近期高关注预印本) |
| 抽取方式 | shuf -i 1-24 -n 3 → 输出 19, 20, 13,首抽 #19 资料充分,重抽次数 0 |
| 核心论文 | Tempo(ECCV 2026,Meta AI + KAUST) |
| 去重索引 | ⚠️ 未能访问。本次为云端定时任务,无桌面桥接,ml-report-index.md 不可达,本期无法执行 14 天去重校验;详见文末脚注 |
arxiv.org/html/2604.08120v1)、项目主页与 GitHub README,并标注了表号。凡是我没有读到的(如延迟/FLOPs 实测、标准差、v2 版本日期),全部在正文中明确标注为「论文未提供」或「未找到」,没有任何一个数字来自记忆推断。
所有链接均经实际抓取验证。✅ 已确认可达,⚠️ 存在但抓取受限或信息不一致,❌ 未找到。
| 资源 | 链接 | 状态 |
|---|---|---|
| arXiv 摘要页 | arxiv.org/abs/2604.08120 | ✅ |
| arXiv 全文 HTML(v1) | arxiv.org/html/2604.08120v1 | ✅ 本报告数据主要来源 |
| arXiv PDF | arxiv.org/pdf/2604.08120 | ✅ |
| 项目主页 | feielysia.github.io/tempo-page | ✅ |
| 代码仓库 | github.com/FeiElysia/Tempo | ✅ Apache-2.0 |
| 模型权重(最终) | huggingface.co/Vision-CAIR/Tempo-6B | ✅ 学术非商用 |
| 模型权重(分阶段) | Vision-CAIR/Tempo-6B-Stage0 / Stage1 / Stage2 | ✅ 三个中间 checkpoint 全部公开 |
| HF 论文页 | huggingface.co/papers/2604.08120 | ✅ 21 upvotes |
| 在线 Demo | huggingface.co/spaces/Vision-CAIR-Admin/Tempo | ⚠️ 项目页写作 Vision-CAIR/Tempo,HF 论文页列出的实为 Vision-CAIR-Admin/Tempo 与 SwingRain/Tempo,两处不一致 |
| ECCV 2026 官方 proceedings | — | ❌ 未找到(ECVA 尚未上线;venue 信息来自 GitHub README 与项目页自我标注) |
| KAUST 机构仓库副本 | repository.kaust.edu.sa/… | ✅ |
2604.08120 按 arXiv 编号规则对应 2026 年 4 月。HF 论文页渲染出的「April 10, 2024」与该规则矛盾,判定为 HF 页面解析错误,本报告采用 2026 年 4 月 v1。v2 是否存在及其日期:未找到(export.arxiv.org API 在本会话被出口策略拦截,返回 403)。
| 论文 | 会议主页 / Proceedings | arXiv | Code | 权重 | 项目页 |
|---|---|---|---|---|---|
| LLaMA-VID | ECVA ECCV 2024 ✅ · Springer ✅ pp.323–340 | 2311.17043 ✅ v1: 2023-11-28 |
JIA-Lab-research ✅ | HF ✅ | llama-vid.github.io ✅ |
| LongVA | ❌ 未找到(无 venue 声明,OpenReview 被 bot 墙拦截,按预印本处理) | 2406.16852 ✅ v1: 2024-06-24 v2: 2024-07-01 |
EvolvingLMMs-Lab ✅ | HF ✅ | lmms-lab.com ✅ |
| LongVU | ICML 2025 Poster 44939 ✅ 主会 | 2410.17434 ✅ v1: 2024-10-22(仅 v1) |
Vision-CAIR ✅ | HF ✅ | vision-cair.github.io ✅ |
| BIMBA | CVPR 2025 Poster 32662 ✅ 主会 · CVF 补充材料 ✅(正文 PDF 返回 403 ⚠️) | 2503.09590 ✅ v1: 2025-03-12 v2: 2025-03-13 |
md-mohaiminul ✅ | HF ✅ | ⚠️ sites.google.com/view/bimba-mllm 抓取被拦 |
| VideoChat-Flash | OpenReview ICLR 2026 Poster ✅ 主会 | 2501.00574 ✅ v1: 2024-12-31 v4: 2025-07-13 |
OpenGVLab ✅ | HF ✅ | InternVideo blog ✅ |
| STORM (效率对照组) |
CVF ICCVW 2025 CLVL ⚠️ Workshop,非主会 | 2503.04130 ✅ v1: 2025-03-06 v2 日期未找到 |
❌ 未找到官方仓库 | ❌ 未找到 | research.nvidia.com ✅ |
github.com/dvlab-research/LLaMA-VID 已迁移至 JIA-Lab-research/LLaMA-VID,旧链接虽仍重定向,引用时应使用新路径。
Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu
Meta AI · KAUST — ECCV 2026 — arXiv 2604.08120(2026 年 4 月)
这句话的关键不在「用小模型压缩」(BIMBA、LongVU 都在做压缩),而在同一次前向、双输出:相关性打分不是外挂一个 retriever 算出来的,而是从压缩器本身的隐状态上截胡出来的,因此压缩与打分严格共享同一份多模态上下文,且路由开销是 O(1)。
论文指向的痛点被表述为结构性错配:视频流是密集的、时长可变的,而 LLM 上下文是固定的、稀缺的。论文原文:稠密视觉流「quickly saturate input token budgets and exacerbate the lost-in-the-middle phenomenon」(引 Liu et al., 2024c)。
| 现有做法 | 论文的指控(原文) | 失效的物理原因 |
|---|---|---|
| 稀疏采样 | "risks skipping the transient yet decisive moments required to answer a specific query" | 均匀采样与「答案在哪一秒」无关,是一个与查询独立的先验 |
| 均匀池化 | "blur fine-grained evidence in query-critical segments while wasting representational bandwidth on irrelevant backgrounds" | 把带宽平均分给了信息密度极不均匀的片段 |
这个问题的新颖之处在哪? 不在于「长视频难」(老问题),而在于论文把它重新定义为一个带宽分配问题而非压缩率问题。此前的工作几乎全部在优化「每帧压到几个 token」这个标量(LLaMA-VID 压到 2,VideoChat-Flash 压到 16,BIMBA 压 16×),Tempo 主张:每帧压到几个 token 这件事本身就不应该是一个常数。
为什么值得解决? 一个可量化的论据来自论文自己的表 1:Qwen2.5-VL-7B 用 1924 tokens/frame 在 Video-MME 上拿 65.1,而 Tempo 用实测均值约 2.8–3.6 tokens/frame 拿 67.8。这是约 687 倍的 token 差距换来 +2.7pp 的反向收益——说明现有系统投入的绝大部分视觉带宽是被浪费的,而这个浪费是可以被系统性回收的。
论文的推进逻辑可拆成四步,每一步都是一个「观察 → 推断」:
隐含的设计权衡(论文没明说,但从设计可读出):
k_max 个 memory token,而不让 SVLM 自回归决定要写多少(论文承认这是「a profound optimization challenge」)。端到端目标——注意:没有任何辅助压缩损失、没有路由网络、没有蒸馏损失,只有一个标准自回归损失:
固定容量 k_max 本身充当结构性瓶颈,逼出压缩行为。这是本文方法上最「省」的一笔——压缩能力是训练目标的副产品,不是被显式监督出来的。
零样本相关性先验——设 h_i^rel 为 SVLM 对「这段与查询相关吗」这一二元问题作答前的最后隐状态,w_yes / w_no 为冻结的语言头权重:
这是整篇论文最漂亮的一处工程设计:把一次本该自回归解码的判断,退化成一次向量内积。且论文强调 s_i 与 H_i 在同一次前向中提取(截胡隐状态后前向继续),保证两者条件于完全相同的多模态上下文。
ATA 两阶段分配:
头部截断的合理性依据是论文提出的 「语义前置」(semantic front-loading) 假说:因果注意力会把最显著的证据压进最靠前的 memory token。这个假说在消融中被强证据支持(见 §2.5.3-C)。
| 机制 / 维度 | 设计选择 | 动机 | 关键超参 |
|---|---|---|---|
| 局部压缩器 | Qwen3-VL-2B-Instruct(可训练) | 现成的跨模态理解能力,无需新算子 | SVLM lr = 2×10⁻⁶ |
| 全局解码器 | Qwen3-LM-4B | 只负责在稀疏序列上推理 | lr = 1×10⁻⁵ |
| 记忆槽位 | 可学习 memory token,置于因果序列末尾 | 保证每个 M 能看到全部视觉+查询上下文 | k_max = 128 |
| 相关性打分 | 冻结语言头的 yes/no logit 差 + Sigmoid | O(1),避免自回归开销 | 无(零样本,无训练) |
| 预算分配 | 两阶段线性 + 比例回退 | 连续分配优于二值 top-K | B_max ∈ {4K, 8K};k_min = 4 |
| 段内削减 | 动态头部截断 H_i[1:k_i] | 语义前置假说;O(1) 切片 | k_i ∈ [4, 128] |
| 时间锚点 | 最低保底 k_min = 4 token | 保持时间连续性,避免「断片」 | k_min = 4 |
| 时间定位 | 显式时间戳前缀 <t=2.0s> | 保留段的时序身份与因果顺序 | 2 FPS 采样 |
四阶段渐进课程(附录表 A,模块冻结状态是关键):
| 配置 | Stage 0 对齐 | Stage 1 预训练 | Stage 2 广域 SFT | Stage 3 长上下文 SFT |
|---|---|---|---|---|
| 局部压缩器 SVLM | 冻结 | 解冻 | 解冻 | 冻结 |
| Memory token | 解冻 | 解冻 | 解冻 | 冻结 |
| 线性投影层 | 解冻 | 解冻 | 解冻 | 冻结 |
| 全局解码器 LLM | 冻结 | 解冻 | 解冻 | 解冻 |
| LR(LLM/投影/记忆) | 1×10⁻³ | 1×10⁻⁵ | 1×10⁻⁵ | 1×10⁻⁵ |
| LR(SVLM) | — | 2×10⁻⁶ | 2×10⁻⁶ | — |
| 全局 batch size | 128 | 256 | 128 | 64 |
| 最大采样帧数 f_max | 1(纯图) | 8 | 128 | 384 |
| 段容量 k_max | 128 | 128 | 128 | 128 |
| LLM 最大上下文 | 8192 | 8192 | 8192 | 16384 |
| Warmup / Epoch | 3% / 1 | 3% / 1 | 3% / 1 | 3% / 1 |
数据混合(附录表 B):
| 模态 | Stage 0 | Stage 1 | Stage 2 | Stage 3 | 合计 |
|---|---|---|---|---|---|
| 图像 | ~558K | ~2.00M | ~0.93M | — | ~3.49M |
| 视频 | — | ~1.38M | ~2.25M | ~384K | ~4.01M |
| 文本 | — | ~143K | ~71K | — | ~214K |
| 小计 | ~558K | ~3.52M | ~3.25M | ~384K | ~7.71M |
| 基准 | 平均时长 | 侧重能力 |
|---|---|---|
| LongVideoBench | 473 s | 参照式推理,需定位到具体帧 |
| MLVU | 651 s | 多任务综合长视频理解 |
| Video-MME (w/o sub.) | 1010 s | 综合,含短/中/长三档 |
| Video-MME Long | 2386 s | 长视频子集 |
| LVBench | 4101 s | 极端长视频(>1 小时),本文主战场 |
这个基准梯度设计得很好:时长从 473s 单调递增到 4101s,可以直接读出方法随时长的退化曲线。
单位 pp = percentage point。粗体为该列最优。
| 方法 | 规模 | tok/frame | LongVB 473s | MLVU 651s | VMME 1010s | VMME-L 2386s | LVBench 4101s | 5 项均值 |
|---|---|---|---|---|---|---|---|---|
| — 闭源模型 — | ||||||||
| GPT-4o | — | — | 66.7 | 64.6 | 71.9 | 65.3 | 30.8 | 59.86 |
| Gemini 1.5 Pro | — | — | 64.0 | — | 75.0 | 67.4 | 33.1 | — |
| — 通用开源 MLLM — | ||||||||
| VideoChat2-HD | 7B | 72 | — | 47.9 | 45.3 | 39.8 | — | — |
| LLaVA-OneVision | 7B | 196 | 56.4 | 64.7 | 58.2 | — | — | — |
| LLaVA-Video | 7B | 676 | 58.2 | 70.8 | 63.3 | — | — | — |
| VideoLLaMA3 | 7B | ≤91 | 59.8 | 73.0 | 66.2 | 54.9 | 45.3 | 59.84 |
| InternVL3.5 | 8B | 256 | 62.1 | 70.2 | 66.0 | — | — | — |
| Molmo2 | 8B | 83 | 67.5 | — | 69.9 | — | 52.8 | — |
| Qwen2.5-VL | 7B | 1924 | 56.0 | 70.2 | 65.1 | — | 45.3 | — |
| Qwen3-VL ← Tempo 的压缩器底座 | 2B | ≤640 | — | 68.3 | 61.9 | — | 47.4 | — |
| Qwen3-VL ← 见批判 ③ | 8B | ≤640 | — | 78.1 | 71.4 | — | 58.0 | — |
| — 长视频专用 MLLM — | ||||||||
| LLaMA-VID | 7B | 2 | — | 33.2 | 25.9 | — | 23.9 (13B) | — |
| LongVA | 7B | 144 | — | 56.3 | 52.6 | 46.2 | — | — |
| Kangaroo | 8B | 256 | 54.8 | 61.0 | 56.0 | 46.7 | 39.4 | 51.58 |
| LongLLaVA | 13B | 144 | 53.5 | — | 53.8 | 46.4 | — | — |
| LongVILA | 7B | 196 | 57.1 | — | 60.1 | 47.0 | — | — |
| LongVU ← 见批判 ④ | 7B | 64 | — | 65.4 | 60.6 | 59.5 | — | — |
| Storm | 7B | 64 | 60.5 | 72.9 | 63.4 | 53.4 | — | — |
| BIMBA | 7B | 36 | 59.5 | 71.4 | 64.7 | — | — | — |
| VideoChat-Flash | 7B | 16 | 64.7 | 74.7 | 65.3 | 55.4 | 48.2 | 61.66 |
| Tempo(4K 预算) | 6B | 0.5–16 实测 2.8–3.6 | 64.5 | 75.6 | 67.8 | 57.8 | 52.7 | 63.68 |
| Tempo(8K 预算) | 6B | 0.5–16 实测 3.1–4.3 | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 |
图 1 · Tempo 相对最强开源竞品的优势随视频时长单调放大
数据来源:论文表 1。横轴按基准平均时长升序排列(473s → 4101s)。柱顶数字为 Δ(Tempo 4K − VideoChat-Flash)。悬浮查看具体数值。
相对提升计算(Tempo 4K vs. 最强开源长视频专用基线 VideoChat-Flash):
| 基准 | VideoChat-Flash | Tempo 4K | Δ | 相对提升 |
|---|---|---|---|---|
| LongVideoBench (473s) | 64.7 | 64.5 | −0.2 pp | −0.31% |
| MLVU (651s) | 74.7 | 75.6 | +0.9 pp | +1.20% |
| Video-MME (1010s) | 65.3 | 67.8 | +2.5 pp | +3.83% |
| Video-MME Long (2386s) | 55.4 | 57.8 | +2.4 pp | +4.33% |
| LVBench (4101s) | 48.2 | 52.7 | +4.5 pp | +9.34% |
| 5 项均值 | 61.66 | 63.68 | +2.02 pp | +3.28% |
在几乎相同的 token 预算下(LLaMA-VID 固定 2 tokens/frame vs. Tempo 实测均值 2.8 tokens/frame):
| 基准 | LLaMA-VID (2 tok/f) | Tempo 4K (~2.8 tok/f) | Δ |
|---|---|---|---|
| MLVU | 33.2 | 75.6 | +42.4 pp |
| Video-MME | 25.9 | 67.8 | +41.9 pp |
| LVBench | 23.9 (13B) | 52.7 (6B) | +28.8 pp |
图 2 · token 预算与性能的帕累托前沿:一条「向左上折返」的演进轨迹
横轴为每帧视觉 token 数(对数刻度),纵轴为 MLVU 得分。数据来源:论文表 1。虚线连接技术脉络的时间顺序,可见轨迹先向右上(增加 token 换性能),再向左上折返(token 大幅下降、性能继续上升)。单一纵轴,无双 Y 轴。
| 配置 | 预算 | LongVB | MLVU | VMME | VMME-L | LVBench | 均值 |
|---|---|---|---|---|---|---|---|
| w/o Stage 3(长上下文 SFT) | 16K | 61.4 | 67.2 | 66.1 | 56.3 | 47.3 | 59.66 |
| w/o ATA | 16K | 62.8 | 73.5 | 67.0 | 56.2 | 51.1 | 62.12 |
| Tempo 默认 | 8K | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 |
w/o ATA 用 16K 预算只拿到 62.12,而完整 Tempo 用 8K 预算(一半)拿到 63.46。预算减半、性能反升 1.34pp。这是全文对 ATA 最强的辩护——它证明「分配方式」的价值超过了「分配总量」的价值。Stage 3 的贡献同样巨大:MLVU 上 67.2 → 75.2,+8.0pp,是全表最大单项落差。
w/o ATA 结果。见 §2.7 批判 ②。
| 策略 | LongVB | MLVU | VMME | VMME-L | LVBench | 均值 | vs. ATA |
|---|---|---|---|---|---|---|---|
| 对抗式路由(保留最低分片段) | 50.7 | 59.3 | 52.4 | 47.8 | 36.9 | 49.42 | −14.04 pp |
| 随机丢弃 | 59.3 | 70.9 | 63.6 | 55.2 | 49.8 | 59.76 | −3.70 pp |
| 均匀子采样 | 61.9 | 74.0 | 66.3 | 55.2 | 49.9 | 61.46 | −2.00 pp |
| 硬 Top-K 路由(保留最高分片段) | 63.5 | 73.9 | 66.7 | 56.2 | 52.7 | 62.60 | −0.86 pp |
| ATA(连续分配) | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 | — |
图 3 · 对抗式路由的崩塌:相关性分数确实携带真实信息
五种段级预算分配策略的 5 基准均值(数据来源:论文表 2-B,均值由本报告计算)。关键在于对抗式路由低于随机丢弃 10.34pp——若分数是噪声,反向使用应等于随机。悬浮查看数值。
s_i 是噪声,反向使用它的性能应当等于随机;实际上反向使用显著劣于随机,说明 s_i 中确实编码了真实的查询-片段相关性信息。这一条比任何正向 SOTA 数字都更能证明零样本相关性先验是有效的。
| 方案 | LongVB | MLVU | VMME | VMME-L | LVBench | 均值 |
|---|---|---|---|---|---|---|
| 均匀尾部截断(固定 64) | 59.5 | 71.6 | 64.1 | 54.8 | 41.8 | 58.36 |
| 动态尾部截断(保留后 k_i 个) | 61.9 | 73.4 | 64.8 | 54.2 | 50.5 | 60.96 |
| 均匀头部截断(固定 64) | 63.2 | 73.4 | 66.9 | 56.2 | 51.5 | 62.24 |
| Token Merging(合并到 k_i 个) | 63.6 | 74.9 | 66.3 | 55.4 | 53.0 | 62.64 |
| 动态头部截断(默认) | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 |
| 打分来源 | LongVB | MLVU | VMME | VMME-L | LVBench | 均值 |
|---|---|---|---|---|---|---|
| 基座模型先验(显式路由 prompt) | 65.7 | 76.3 | 67.6 | 57.3 | 52.7 | 63.92 |
| Tempo SVLM 先验(标准 prompt) | 64.1 | 75.4 | 67.2 | 57.0 | 53.4 | 63.42 |
| 基座模型先验(标准 prompt) | 64.6 | 75.1 | 67.2 | 56.1 | 52.6 | 63.12 |
| 外部稠密检索器(Qwen3-VL Reranker) | 64.3 | 75.4 | 67.2 | 57.0 | 51.8 | 63.14 |
| Tempo SVLM 先验(显式路由 prompt)← 论文默认 | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 |
| 方案 | LongVB | MLVU | VMME | VMME-L | LVBench | 均值 |
|---|---|---|---|---|---|---|
| 硬剪枝(无关片段给 0 token) | 63.9 | 74.8 | 67.4 | 56.3 | 52.3 | 62.94 |
| 最小时间锚点 k_min = 4 | 65.1 | 75.2 | 67.7 | 57.0 | 52.3 | 63.46 |
k_min = 4 的贡献仅 +0.52pp,是五组消融里最小的。设计上它是必要的(防止时间轴断裂),但定量收益远小于 ATA(+2.00pp vs 均匀)和头部截断(+2.50pp vs 尾部)。
| 基准 | Tempo 4K | Tempo 8K | Δ(8K − 4K) |
|---|---|---|---|
| LongVideoBench (473s) | 64.5 | 65.1 | +0.6 |
| MLVU (651s) | 75.6 | 75.2 | −0.4 |
| Video-MME (1010s) | 67.8 | 67.7 | −0.1 |
| Video-MME Long (2386s) | 57.8 | 57.0 | −0.8 |
| LVBench (4101s) | 52.7 | 52.3 | −0.4 |
| 均值 | 63.68 | 63.46 | −0.22 |
论文反复强调 ATA 的 O(1) 复杂度、"single forward pass"、"避免自回归开销"。但——
不是「用小模型压缩视频」(BIMBA 已在做学习式压缩),也不是「query-aware」(LongVU 已在做)。Tempo 真正的贡献是把「压缩」和「路由」合并成同一次前向的两个输出。
这一点的关键性在于:此前所有 query-aware 方法都面临一个两难——要么用启发式打分(LongVU 的 DINOv2 相似度 + 注意力,便宜但与语义脱节),要么用外部检索器(准确但昂贵,且与压缩器的表征空间不一致)。Tempo 指出第三条路:压缩器在压缩的过程中已经「想过」这个问题了,只需要把它的想法读出来。论文表 2-D 用一个干净的对照证明了这一点——外部稠密检索器(63.14)并不优于免费截胡的内部先验(63.46)。
s = σ((w_yes − w_no)ᵀh)。完全通用:任何基于因果 LM 的系统,只要需要一个二元判断的连续置信度,都可以用它替代自回归解码,代价 O(1)。可直接迁移到 RAG 重排、Agent 工具选择、数据清洗打分。Tempo 打开的研究空间是「分层路由」:论文自己在第 6 节点出方向——让全局 LLM 变成一个主动路由 agent,按需向下请求某些片段的高分辨率表征。这实际上是把当前的「一次性压缩 + 一次性解码」变成「多轮 agentic 检索」。如果这条路走通,长视频理解会从「压缩问题」彻底转型为「Agent 检索问题」,与当前 LLM 侧的 deep research / agentic RAG 潮流合流。
表 2-B 中硬 Top-K 路由在 LVBench 拿 52.7 > ATA 的 52.3;表 2-C 中 Token Merging 拿 53.0 > 52.3;表 2-D 中 Tempo SVLM 标准 prompt 拿 53.4 > 52.3——后者是全表 LVBench 最高分,比论文主表宣称的 SOTA(52.7)还高 0.7pp。论文的核心叙事是「自适应连续分配对极端长视频最关键」,但恰恰在时长最长的基准上,连续分配输给了二值分配。这与论文的主张不一致。
合理的机制解释是:LVBench 视频长达 4101s,段数 N 极大,此时 ATA 的比例回退公式 k_i = k_min + [B_res · ŝ_i / Σŝ_j] 会因 Σŝ_j 过大而把每段压到接近 k_min,退化成近似均匀分配;而硬 top-K 至少保证被选中的段拿到满容量。论文未讨论 ATA 在大 N 极限下的退化行为,这是一个明确的论证缺口。
表 2-A 中 w/o Stage 3 与 w/o ATA 均在 16K 预算下测量,而默认行在 8K。这使得「Stage 3 贡献 +3.80pp」和「ATA 贡献 +1.34pp」两个结论都是预算与组件混淆的产物。论文没有提供 8K 下的 w/o ATA 对照,也没有提供 16K 下的完整 Tempo。严格地说,表 2-A 无法单独归因。
Tempo 的两个组件都来自 Qwen3 family(Qwen3-VL-2B + Qwen3-LM-4B),但表 1 中 Qwen3-VL-8B 在三个共享基准上全面领先:
| 基准 | Qwen3-VL-8B | Tempo 4K (6B) | Δ |
|---|---|---|---|
| MLVU | 78.1 | 75.6 | −2.5 pp |
| Video-MME | 71.4 | 67.8 | −3.6 pp |
| LVBench | 58.0 | 52.7 | −5.3 pp |
| 三项均值 | 69.17 | 65.37 | −3.80 pp |
一个参数更多但架构更简单的同族模型,在所有共享基准上都比 Tempo 好,且差距同样随时长扩大(−2.5 → −3.6 → −5.3)。论文正确地把 Tempo 定位为 6B 规模下的 SOTA,但没有讨论:如果把 Tempo 的框架套在 8B 底座上会怎样?或者反过来,Qwen3-VL-8B 在同等 token 预算约束下会怎样?缺少这个 head-to-head,「压缩优于扩容」这一核心命题就没有被真正证明。
LongVU(ICML 2025,64 tokens/frame,纯启发式无学习)在 Video-MME Long 上拿 59.5,高于 Tempo 4K 的 57.8(−1.7pp)和 Tempo 8K 的 57.0(−2.5pp)。这是本文唯一一处被更早、更简单的方法反超的子任务,论文未作讨论。考虑到 Video-MME Long 平均 2386s,正处在 Tempo 的优势区间内,这个反例削弱了「自适应分配在长视频上普遍占优」的强主张。
如 §2.5.3-D 所述,「基座模型先验 + 显式路由 prompt」均值 63.92,在 5 个基准里赢 4 个,高于论文默认的 63.46。论文既未解释「为什么微调后的 SVLM 作为路由器反而变差」,也未据此更新默认配置。这是一个方法论上的红旗:如果 Tempo 训练损害了 SVLM 的判别校准,那么「压缩器与路由器共享同一次前向」这一核心设计就存在内在张力——压缩训练的目标与路由判别的目标可能是竞争关系。这个假设完全可以用一个简单实验验证(测量 Stage 0/1/2/3 各阶段 checkpoint 的路由 AUC),但论文没有做。
训练用 4 帧/段,推理用 8 帧/段(§4.1)。这是一个 2× 的分布偏移,论文既未解释动机(推测是为了在固定 B_max 下覆盖更多帧),也未提供推理段窗口的敏感性分析。考虑到 k_max = 128 在两种设置下都不变,8 帧/段意味着推理时每帧实际只分到训练时一半的记忆容量。这可能正是 4K 预算优于 8K 的隐藏原因之一(更小的预算迫使 ATA 更激进地区分片段,部分补偿了这个偏移),但论文没有把这两件事联系起来。
如 §2.5.6 所述,全文零延迟/FLOPs/显存数据。更具体的担忧:LVBench 上约 1025 次 2B 前向的开销可能抵消掉全局 LLM 侧的 token 节省。论文用 "O(1)" 描述的仅是路由打分这一步,而非整个压缩流程。把局部的 O(1) 表述用在以效率为卖点的论文标题语境中,存在误导风险。建议后续工作补一张 (延迟, 显存, 精度) 三维帕累托前沿图,与 VideoChat-Flash、STORM 直接对比。
表 2 中至少 5 组关键对比的差距 ≤ 0.9pp(ATA vs Top-K:0.86;默认 vs 基座先验:0.46;k_min=4 vs 硬剪枝:0.52;4K vs 8K:0.22;Token Merging vs 默认:0.82)。单次运行、无 seed 方差报告的前提下,这些差异不足以支撑「设计 X 优于设计 Y」的强结论。论文本可以只在 MLVU 和 LVBench 上跑 3 个 seed 就大幅提升可信度。
以下五篇沿 Tempo 的引用脉络选出,构成一条清晰的问题传递链,而非平行罗列。
① 解决了什么问题。 长视频塞不进 LLM 上下文。LLaMA-VID 给出了当时最激进的答案:每帧只用 2 个 token。具体是一个 Q-Former 从用户指令生成查询 Q_t,经 context attention 聚合出 1 个上下文 token;再由自适应池化产出 1 个内容 token。视觉编码器用 EVA-G。凭这个设计,64K 上下文可容纳超过 3 小时的视频。核心贡献一句话:证明了「每帧 2 token」在工程上是可行的。
② 遗留了什么缺口。 作者自己在结论中承认得非常明确:
更根本的缺口在于:这 2 个 token 的分配是静态的。无论这一秒是关键动作还是空镜头,都是 2 个 token。论文表 5 自己量化了代价——把内容压到 1 个 token 损失 2%–6%。缺口是:压缩率被当作全局常数而非局部变量。
③ 核心工作如何回应。 Tempo 直接回到了同一个 token 量级(实测均值 2.8 vs LLaMA-VID 的 2),但把 MLVU 从 33.2 抬到 75.6(+42.4pp)、Video-MME 从 25.9 抬到 67.8(+41.9pp)。Tempo 对这个缺口的回应可以概括为一句话:不是「2 个 token 不够」,而是「每帧都恰好 2 个 token」这件事错了。 ATA 让某些段拿 128 个 token、某些段只拿 4 个,均值仍在 2.8。
④ 关键设计的传递。 LLaMA-VID 的 context token(由用户指令驱动、聚合文本相关视觉线索)正是 Tempo 的 query-conditioned memory token 的直系祖先。技术迁移路径是:外挂 Q-Former 生成查询 → 直接把查询写进 SVLM 的因果序列。前者需要额外训练一个 Q-Former,后者复用 SVLM 自身的注意力机制,更简洁也更强。
① 解决了什么问题。 LongVA 走的是完全相反的路:既然压缩会丢信息,那就别压,直接把上下文扩大。核心主张是「长上下文迁移」——把 Qwen2-7B-Instruct 的文本上下文续训到 224K(RoPE base 提到 1B,900M tokens / 1000 步),这个能力会零样本迁移到视觉,"without any video training"。配套的 UniRes 编码把视频直接当成一张 336×(336·N) 的长图,N 帧 = 144N 个 token。V-NIAH 上到约 2000 帧(≈288K token)仍近乎满分,超出了训练长度。核心贡献:证明了长上下文能力可以跨模态零样本迁移。
② 遗留了什么缺口。 三个缺口,前两个是作者自承的:
最根本的缺口:扩上下文没有解决「带宽该给谁」的问题,只是把问题推给了硬件。144 tokens/frame 对每一帧一视同仁,与 LLaMA-VID 的 2 tokens/frame 在「均匀性」上是同构的,只是常数不同。
③ 核心工作如何回应。 Tempo 用表 1 直接回应了这条路线的性价比:LongVA 用 144 tokens/frame 拿 Video-MME 52.6,Tempo 用约 3.6 tokens/frame 拿 67.8——token 少 40 倍,分数高 15.2pp。更深的回应在 §2.5.4:Tempo 自己也观测到了「预算翻倍性能反降」(4K 63.68 → 8K 63.46),与 LongVA 的 128→384 帧退化是同一个现象。Tempo 的立场是:既然名义上下文的边际收益会转负,那么正确的方向是提高每个 token 的信息密度,而不是增加 token 数。
④ 关键设计的传递。 LongVA 的贡献不在被 Tempo 继承的机制上,而在于它用一个干净的反例划定了「扩上下文」路线的天花板。它提供的 V-NIAH 评测范式(反事实问题 + 困惑度打分,防止语言先验作弊)也成为后续长视频工作的标准诊断工具,VideoChat-Flash 的 10000 帧 NIAH 实验就是这一范式的延续。
① 解决了什么问题。 第一次把「query-aware」真正落地成一个完整的时空压缩流水线。三步:(i) DINOv2 在 J=8 帧窗口内算平均特征相似度,丢掉与邻帧高度冗余的帧,帧数大致减半;(ii) 跨模态文本引导——按帧特征与文本查询的注意力打分,top-N_h 帧保留 144 tokens/frame(12×12),其余降采样到 64 tokens/frame(8×8);(iii) STC 空间 token 压缩,在 K=8 帧滑窗内剪掉与时序相邻 token 余弦相似度 >θ=0.8 的空间 token,平均再削 40.4%。最终一小时视频塞进 8K 上下文,平均约 2 tokens/frame。核心贡献:证明了「按查询分配不同分辨率」是有效的(表 3:自适应 67.62 vs 均匀 8k@64 的 66.84 与 8k@144 的 66.28)。
② 遗留了什么缺口。 这是整条链上最关键的一个缺口:LongVU 的压缩是启发式且训练无关(training-free)的。θ=0.8、J=8、K=8 全是手调阈值,没有任何东西是从数据中学出来的。DINOv2 的特征相似度衡量的是视觉冗余,而不是对当前问题的有用性——两段画面完全不同的空镜头,DINOv2 会认为都值得保留,但对「他什么时候拧螺丝」这个问题两段都是废的。此外作者自承:视频 SFT 后图像理解能力下降(表 10),因 GPU 资源限制未做混合数据训练。
③ 核心工作如何回应。 Tempo 把这三个手工模块整体替换成一个可学习的 SVLM:不再有 DINOv2 相似度阈值,不再有 top-N_h 硬选择,不再有 STC 余弦阈值——压缩行为完全由 L_AR 这一个自回归损失隐式学出。表 2-B 的对照直接量化了「学出来」相对「手调」的价值:ATA 比均匀子采样高 2.00pp,比随机高 3.70pp。而 Tempo 的四阶段课程(图像/视频/文本混合,共 ~7.71M 样本)也正面回应了 LongVU 自承的图像能力退化问题。
④ 关键设计的传递。 两项直接传递:(i) 「不同片段给不同 token 数」这一核心思想,LongVU 是二档(144/64),Tempo 推广成连续区间 [4, 128];(ii) 文本引导的相关性打分,LongVU 用跨模态注意力算,Tempo 用 SVLM 的 yes/no logit 差算——技术迁移的具体形式是「外部注意力打分 → 模型内部的判别置信度」。
① 解决了什么问题。 LongVU 是启发式的,BIMBA 给出了「学习式压缩」的答案。它在视觉编码器与 LLM 之间插入一个 Mamba 选择性扫描模块:把逐帧 patch 特征展平成一条时空长序列,一组 query token 随选择性扫描前进,由输入相关的门控在每一步决定「写入状态还是丢弃」——压缩因此是内容相关的而非均匀池化。三个关键设计:query 由时空 token 的自适应 3D 平均池化初始化(而非可学习 embedding)、query 交错插入视频 token 之间(而非追加在尾部,以消除位置偏置)、双向扫描恢复 1D 扫描丢失的空间结构。问题条件化通过把 LLM 分词后的问题前置实现:Z' = [X; Z; Q]。压缩比 >16×(36,864 → 2,304 token)。核心贡献:证明了压缩策略可以被端到端学出来,且能做到亚二次复杂度。
② 遗留了什么缺口。 BIMBA 没有 Limitations 章节(这本身值得记一笔)。从缺失处推断的缺口有三个:(i) 压缩后的 token 数 M 与池化比例是固定超参(1×2×2 / 2×2×2 / 4×2×2 按帧数档位切换),不随视频内容或问题难度自适应;(ii) 问题条件化被描述为可选的、且是 prepend 式而非架构级,因此「同一视频多个问题」无法复用单次前向;(iii) 效率只给了曲线,没有绝对数字(无 FLOPs、无 ms、无 GB)。缺口一句话概括:学会了「怎么压」,但没学会「压多少」。
③ 核心工作如何回应。 Tempo 正是补上了 (i):ATA 让每段的 k_i 随相关性在 [4, 128] 连续变化。表 2-B 中「均匀子采样」这一行(61.46)在概念上就是 BIMBA 式固定比例压缩的代理,ATA 相对它 +2.00pp。而 (iii) 这个缺口 Tempo 没有补上——如 §2.7 批判 ⑦ 所述,Tempo 同样只给了 O(1) 的定性表述,没给实测数字。这是整条演进链上唯一一个连续两代都未被填补的缺口。
④ 关键设计的传递。 BIMBA 的组件消融方法论被 Tempo 明显继承(BIMBA 表 1:可学习 query 67.67 → 平均池化初始化 68.61 → +norm 69.85 → +双向 71.68 → +交错 73.57,逐层累加的呈现方式,与 Tempo 表 2 的五分组结构同源)。更实质的传递是「在视觉编码器与 LLM 之间插入一个可学习的压缩瓶颈」这一架构位点——BIMBA 放的是 Mamba 层,Tempo 放的是一整个 2B VLM。技术迁移的形式是「专用序列算子 → 通用预训练模型」,这也是过去两年整个领域的宏观趋势。
① 解决了什么问题。 把 token 效率推到当时的极致,同时保住长上下文能力。HiCo(分层视觉 token 压缩)分两级:clip 级用视频编码器的时空注意力 + 相似 token 合并,把每帧压到均值 16 tokens;video 级在 LLM 推理时做渐进式视觉 dropout(浅层丢约 50%,深层用注意力引导选择),总压缩比约 1/50。配套一个四阶段 short-to-long 训练方案(4 帧 → 8 帧 → 64–512 帧 → 448 高分辨率后微调)。上下文扩到 128K,支持约 10,000 帧。核心贡献:NIAH 单跳检索在 10,000 帧上达到 99.1%(对比 LongVA 3,000 帧 92%、LLaMA-VID 55%)——长视频的「检索」问题基本被解决。
② 遗留了什么缺口。 一个漂亮的、由论文自己数据揭示的缺口:检索接近满分,推理却远未解决。同一篇论文的多跳 NIAVH(图 6)在 10k 帧上 CAP 仅 31.3%、QA 仅 25.4%。即「能找到那一帧」和「能把几帧串起来推理」之间存在巨大鸿沟。机制上的原因是:HiCo 的 clip 级压缩是 query-agnostic 的——16 tokens/frame 对所有帧一视同仁,压缩时并不知道用户要问什么,于是多跳推理所需的那些「看似不重要但组合起来关键」的细节在压缩阶段就已被丢弃。此外作者自承 video 级压缩只能用于推理,因与序列并行等训练加速策略不兼容。
③ 核心工作如何回应。 Tempo 的整个设计就是对「clip 级压缩 query-agnostic」这一条的正面回应:把查询提前注入到压缩的最内层。效果在表 1 上体现为随时长单调扩大的优势(LongVideoBench −0.2pp → LVBench +4.5pp)——正是在最需要跨段组合推理的极长视频上,query-aware 压缩的价值最大。同时 Tempo 的压缩在训练和推理中是一致的(不像 HiCo 的 video 级压缩仅推理可用),这消除了训练-推理不匹配。
④ 关键设计的传递。 两项:(i) short-to-long 渐进课程几乎被 Tempo 一比一继承(VideoChat-Flash:4→8→64–512 帧 + 高分辨率后微调;Tempo:1→8→128→384 帧,四阶段结构完全同构);(ii) 「极低 tokens/frame 也能做 SOTA」这一存在性证明——VideoChat-Flash 用 16 tokens/frame 打平了用 1924 tokens/frame 的 Qwen2.5-VL,直接为 Tempo 把预算再降一个数量级(到均值 2.8)铺平了心理与经验基础。技术迁移形式是「固定的极低预算 → 均值更低但可动态起伏的预算」。
推动力一条线:静态常数 → 手工规则 → 学习算子 → 预训练模型 → 自适应分配
| 阶段 | 压缩由什么决定 | 代表工作 | 关键转折 |
|---|---|---|---|
| 一、静态压缩 | 一个全局超参(2 / 144 / 16 tok/f) | LLaMA-VID, LongVA, VideoChat-Flash | — |
| 二、手工规则 | 人工阈值(θ=0.8, J=8, K=8) | LongVU | 首次引入「不同片段给不同预算」 |
| 三、学习算子 | 一个被端到端训练的专用模块(Mamba) | BIMBA | 压缩策略从手写变成学出来 |
| 四、预训练模型 | 一整个预训练 VLM | Tempo | 压缩器不再是算子,而是模型 |
| 五、自适应分配 | 模型自己输出的相关性打分 | Tempo (ATA) | 「压多少」也变成了模型的输出 |
三个关键转折点:
社区关注点的转移:
| 工作 | 发表年月 | 会议 / 出版 | 核心贡献 | tok/frame | 关键指标 | 与核心工作的关系 |
|---|---|---|---|---|---|---|
| LLaMA-VID | 2023.11 | ECCV 2024 主会 | 每帧 2 token 的极限压缩;Q-Former 上下文 token | 2 | MLVU 33.2 · VMME 25.9 | token 预算的起点;Tempo 在同量级下 +42.4pp |
| LongVA | 2024.06 | arXiv(venue 未找到) | 长上下文跨模态零样本迁移;UniRes | 144 | VMME 52.6 @128帧 | 反例与边界;证明扩上下文会撞墙 |
| LongVU | 2024.10 | ICML 2025 主会 Poster | 启发式时空自适应压缩;文本引导选帧 | ~2 (自适应 144/64) | MLVU 65.4 · VMME 60.6 · VMME-L 59.5 | 直系前作(同团队 Meta+KAUST,多位共同作者);Tempo 把手工规则换成学习式 |
| BIMBA | 2025.03 | CVPR 2025 主会 Poster | Mamba 选择性扫描学习式压缩;交错 query + 双向扫描 | ~36 (16× 压缩) | MLVU 71.4 · VMME 64.7 · NExT-QA 83.73 | 学习式压缩的源头;Tempo 继承其架构位点,补上「压多少」的自适应 |
| VideoChat-Flash | 2024.12 | ICLR 2026 主会 Poster | HiCo 分层压缩;short-to-long 课程;128K/10000 帧 | 16 | MLVU 74.7 · VMME 65.3 · LVBench 48.2 · NIAH 99.1%@10k | 最强直接竞品;Tempo 继承其训练课程,回应其 query-agnostic 缺口 |
| STORM (对照) | 2025.03 | ICCVW 2025(Workshop) | Mamba 时序投影器;训练/测试期时空池化 | 64 (25%→12.5%) | MLVU 72.9 · LVB 60.5 · 延迟 −65.5% | 效率论证的正面样板;唯一给出实测延迟的对照工作 |
| ★ Tempo | 2026.04 | ECCV 2026 | SVLM 作压缩器 + 同前向截胡相关性 + ATA 自适应预算 | 0.5–16 实测 2.8–3.6 | MLVU 75.6 · VMME 67.8 · VMME-L 57.8 · LVBench 52.7 | 汇聚点 |
不是泛泛地「研究长上下文」,而是一个具体的测量问题:LongVA(128→384 帧退化 0.8pp)、Tempo(4K→8K 预算退化 0.22pp)、STORM(自承有效上下文小于名义上下文)三处独立观察指向同一现象,但没有任何一篇给出这个拐点的定量刻画。
具体可操作的实验设计:固定模型、固定视频集,只扫描注入的视觉 token 数 B ∈ {1K, 2K, 4K, 8K, 16K, 32K},在每个 B 上分别测量 (a) 端到端任务准确率、(b) 一个纯检索探针(NIAH 式)的准确率、(c) 注意力熵在视觉 token 区间上的分布。假设是:(b) 会持续上升而 (a) 在某个 B* 后转降,说明退化发生在推理而非检索环节。若成立,则「有效上下文」可以被定义为 B* = argmax_B accuracy(B),并可进一步问:B* 是否随 LLM 规模缩放?这是一个单模型、单周实验就能做完的高价值空白。
如 §2.7 批判 ① 所推断,当段数 N → B_max / k_min 时,ATA 的比例回退公式会退化为近似均匀分配。具体问题:给定 B_max、k_min、段数 N 和分数分布 {ŝ_i} 的熵 H(ŝ),能否给出 ATA 相对硬 top-K 的性能差的解析界?这直接解释了 LVBench 上 ATA 输给 top-K 的现象,且可导出一个自适应切换规则(当 N 超过阈值时自动退化为 top-K)。
表 2-D 显示微调后的 SVLM 作路由器不如未微调的基座(63.46 vs 63.92)。具体实验:取 Tempo 公开的 Stage0/1/2/3 四个 checkpoint,在同一批 (片段, 查询, 相关性标签) 数据上测量各自的路由 AUC。若 AUC 随训练阶段单调下降,就证实了「压缩训练损害判别校准」这一假设,并直接指向一个多任务损失的修复方案。四个 checkpoint 已全部公开,这个实验的门槛极低。
这是整条演进链上连续两代(BIMBA、Tempo)都未填补的缺口。现状是每篇论文各报各的定性效率主张(BIMBA 只给曲线、Tempo 只给 O(1) 表述),无法横向比较。具体建议:在固定硬件(如单张 A100-80G)、固定视频集(LVBench 全集)下,对 LongVU / BIMBA / VideoChat-Flash / STORM / Tempo 统一测量端到端 wall-clock、峰值显存、准确率三元组。特别需要回答 §2.7 批判 ⑦ 提出的问题:Tempo 在 4101s 视频上约 1025 次 2B 前向的开销,是否真的低于 VideoChat-Flash 的一次性分层压缩?这是一个纯工程、无需新方法的高价值工作。
Tempo 自承的第三个局限。当前每换一个问题就要重压整段视频,成本 O(轮数 × 视频长度)。具体问题:能否设计一种「查询无关的粗压缩 + 查询相关的细化」两级缓存?粗压缩只做一次并缓存,细化在每轮只对 top-k 个候选段做。关键的实验空白:这种两级方案相对 Tempo 单级方案的精度损失是多少?在几轮之后能摊薄成本?
现有全部五代工作都是离线的——假设整段视频可以被一次性访问。但真实的具身智能与视频助手场景是流式的:视频还在生成,且未来的问题尚未提出。具体问题:当 s_i 必须在看到未来片段之前就决定时,ATA 的 Min-Max 归一化(依赖全局 max(s) 与 min(s))完全失效。需要设计一个在线版本——用滑动窗口分位数替代全局 Min-Max?还是用一个可学习的绝对阈值?这是一个定义清晰、当前完全空白的方向。
Tempo 自己在第 6 节点出:让全局 LLM 成为主动路由 agent,按需向下请求高分辨率片段。具体化这个想法:这实际上是把长视频理解转化为一个工具调用问题——LLM 的工具是 zoom_in(segment_id, resolution)。关键的对比实验空白是:「一次性最优分配」(Tempo)vs「多轮自适应检索」(Agent),在相同的总 token 预算下谁更优?这个 head-to-head 目前完全没人做,但它决定了整个子领域未来两年的走向。
Tempo 自承路由完全零样本。论文提出可用 SFT 或 RL 增强,但没有论证哪一个更合适,这本身就是一个明确的对比实验空白。SFT 需要 (片段, 查询, 相关性) 三元组标注——可以用现有的时序定位数据集(如 Charades-STA、QVHighlights)的 ground-truth 区间自动构造。RL 则可以用最终答案正确性作为奖励,无需中间标注但信号更稀疏。建议在相同硬件预算、相同数据预算下 head-to-head 对比这两种策略,并特别关注:RL 路由是否会学到「多要 token 总没错」的退化策略(因为奖励不惩罚 token 消耗)?如果会,就需要在奖励中显式加入预算惩罚项——这直接连回了 §6.1① 的有效上下文问题。
当前所有工作的相关性打分都只基于视觉+文本查询。但 Video-MME 的「w/ subtitles」设置普遍带来数 pp 提升(VideoChat-Flash:65.3 → 69.7,+4.4pp)。具体问题:字幕/音频轨道是否可以作为一个廉价的路由先验?即先用纯文本的字幕检索粗筛出候选段,再对候选段跑昂贵的视觉压缩。这可能把 §6.2④ 的 1025 次 SVLM 前向砍掉一个数量级。对齐目标是什么——是让音频相关性分数与视觉相关性分数在同一标度上可比,还是让它们各自路由后取并集?这是一个尚未被定义清楚的问题。
本期未展开详述,均为 CVPR 2026 Highlights 或近期高关注度预印本(同属本周二「视觉与多模态」轮转领域)。
DeepMind 系团队(Kabra, Ovsjanikov, Hudson, Carreira, Mitra 等)重新审视自监督视觉编码器的数据配方。值得看的原因:在 DINO 系列已成为几乎所有视频压缩工作(含 LongVU)的默认冗余度量工具的当下,改进 DINO 本身的通用性会向下游整条链传导。
CVPR 2026 Highlights
与 Tempo 正交的效率路线:不压缩 token,而是改变视觉 token 进入 LLM 的方式(交叉注意力而非拼接)。值得看的原因:与 Tempo 放在一起读可以看清「减少 token」与「改变 token 消费方式」两条独立轴。
arXiv
主张视频生成模型的表征可以直接迁移到判别任务。值得看的原因:若成立,长视频理解的编码器侧可能会被生成式预训练整体替换——这是对本报告整条演进链的一个潜在颠覆。
arXiv
长期个性化多模态 LLM。值得看的原因:与 Tempo 自承的「多轮对话需重压视频」局限直接相关——个性化记忆与查询感知压缩如何共存是一个自然的交叉点。
CVPR 2026 Highlights
评测向工作,考察 VLM 在多智能体环境中的策略能力。值得看的原因:代表了 §4.2 中提到的「从检索转向推理」这一社区关注点转移。
项目页
用感知证据锚定多模态推理的 RL 方法。值得看的原因:与 §6.3⑧ 提出的「路由能力后训练」直接相关——如何用 RL 让模型学会「该看哪里」。
CVF Open Access
统一生成与自验证。值得看的原因:其「优势解耦」思想与 Tempo 表 2-D 揭示的「压缩目标 vs 判别目标可能竞争」问题(见 §6.1③)有潜在联系。
CVPR 2026 Highlights