一句话核心定位: AVUT 用音频中心任务、新视频与四次循环选项过滤,主动切断“只读问题和选项就能答对”的捷径;同一 Gemini 1.5 Pro 的完整音视频准确率比视觉单模态高 15.56 个百分点,但独立文本模型在过滤后仍有 4.50% 循环命中,故“无捷径”应理解为强抑制而非绝对消除。
1. 链接验证表与证据边界
所有链接均实际访问。页码指 EMNLP 最终 PDF 印刷页码,必要时附 PDF 页序。论文最初名为 ACVUBench,正式版改名 AVUT,二者不是两篇工作。
| 对象 | 会议/正式页 | arXiv(版本、日期) | 代码 | 数据/权重 | 项目页/视频 |
|---|---|---|---|---|---|
| AVUT(核心) | EMNLP 2025 Main, pp.6569–6587 | 2503.19951v3, 2025-09-28;v1 首投 2025-03-25 | GitHub | HF 数据集;模型权重不适用 | 未找到独立项目页/视频 |
| Video-MME | CVPR 2025 | 2405.21075v4 | GitHub | 仓库提供数据说明 | 项目页 |
| AVHBench | ICLR 2025 | 2410.18325 | GitHub | 仓库提供基准 | 项目页 |
| LongVALE | CVPR 2025 PDF | 2411.19772 | GitHub | HF | 视频未找到 |
| MUSIC-AVQA-R | NeurIPS 2024 | 2404.12020 | OpenReview 所列资源 | 基于 MUSIC-AVQA 重构 | 项目页未找到 |
“论文原报”只指 PDF 正文/表格可读数值;“本报告复算”只做减法和除法。AVUT 未报告置信区间、标准差、显著性或标注者一致性,故不写“显著优于”。
2. 候选池、排重与随机选择
先查 ml-report-index.md,排除最近 14 天的 MMedPO、Visual
Graph Arena、Q-VDiT、DocVXQA 等主题。通过 ACL
Anthology、arXiv、OpenReview、会议页及公开仓库交叉收集 24 篇:UniVLG;Do
VLMs Really Understand Visual Language;ELITE;DEFAME;Closed-form
Adversarial Robustness;MTSTRec;CoreMatching;Agent Reviewers;RoG
World Models;video-SALMONN-o1;Hidden Life of Tokens;Compositional
Tabular QA;Orthus;Be
Confident;VL-PRM;MMix;RobustVLA;VSTAT;HAVEN;MVU-Eval;Video-MMLU;MT-Video-Bench;MMIU;AVUT。执行
shuf -i 1-24 -n 1 得 24。初版题名
ACVUBench,经核验为 EMNLP 2025 Main 最终版 AVUT,资料充分,重抽
0 次。
3. Motivation:榜单可能测到“读题能力”
AVUT 表 8(p.6577 / PDF p.9)显示,无视频时 GPT-4o 在 VideoVista、TemporalBench、NExT-QA 分别有 68.00%、65.42%、47.57%,Gemini 为 62.63%、59.37%、48.95%,远超四选一随机 25%。所以视频问答准确率会混入问题措辞、答案长度、选项位置和数据来源先验。
AVUT 表 1(p.6570 / PDF p.2)含 2,662 视频、11,609 QA、8 任务,平均 67.8 秒;AV-Human 为 698 视频/1,734 QA,AV-Gemini 为 1,964 视频/9,875 QA。视频主要采于 2023 年后、英语、≤2 分钟,覆盖 18 个音频中心领域。六个 MCQ 为音频信息抽取 AIE、计数 ACC、事件定位 AEL、音视对应 AVCM、对象匹配 AVOM、时间匹配 AVTM;开放任务为片段匹配 AVSM 与说话人日志 AVDiar。AVDiar 有 260 视频、平均 3.59 位说话者(§3.2,p.6572)。
4. 故事线、假设与权衡
论文先采集新视频;人工构建 AV-Human;Gemini 1.5 Pro 每个 MCQ 任务看 4 个示例生成 AV-Gemini;9,875 个生成 QA 全部经人工审校;再让 GPT-4o 不看视频、在四个循环排列上答题,全对则删除。核心假设是:跨排列稳定正确意味着文本捷径;GPT-4o 能暴露大部分捷径;同一模型完整输入对单模态的增益近似反映模态价值。代价是过滤可能过拟合 GPT-4o、生成器风格写进数据、短视频牺牲长程理解。
5. 形式化、伪代码与流程
设题目 (q=(x_a,x_v,t,O,y)),循环置换集 (C_4={ABCD,BCDA,CDAB,DABC})。过滤指示量: [ S_m(q)=\prod_{\pi\in C_4}\mathbf1[m(t,\pi(O))=\pi(y)]. ] 若 (S_{GPT4o}(q)=1) 则删除。独立均匀猜测四连中的理想概率为 ((1/4)^4=0.390625%),但模型回答不独立,且只覆盖 (4!/4=6) 分之一的排列,不能把它当真实假阳性率。MCQ 为微平均准确率。表 5 的同模型模态增益为: [ \Delta_{AV-V}=78.34-62.78=15.56\text{ pp},\quad 15.56/62.78=24.78%. ]
新视频 ─┬─ 人工:698 视频 → 1,734 QA
└─ Gemini + 4 demos/任务:1,964 视频 → 9,875 QA
↓ 全量人工审校
六类 MCQ → GPT-4o 无视频 × 四循环选项 → 删除稳定文本命中
AVSM/AVDiar ──────────────────────────→ 开放任务评测
↓
12 个模型,多种帧/音频预算 → MCQ、匹配、DWER、GPT 排名、ROUGE-L
6. 关键机制与工程细节
| 机制 | 实现 | 作用 | 代价/来源 |
|---|---|---|---|
| 新数据 | 主要 2023 年后、英语、≤2 分钟 | 降低旧榜记忆 | 无商业训练集审计;§3.1 |
| 双轨构建 | 人工 AV-Human + Gemini AV-Gemini | 质量锚点与规模 | 生成器也是榜首;§3.2–3.3 |
| 全量审校 | 9,875 机器题均审查 | 去错误、多解、错配 | 无一致性/成本;§3.3 |
| 循环过滤 | GPT-4o 文本-only,4 次全对删除 | 压低内容与位置捷径 | 单一模型、4/24 排列;§3.4 |
| 模态消融 | 同一 Gemini 比 AV/转录/V/A | 隔离模态贡献 | 仅一个闭源模型;表 5 |
| 异构适配 | 6–32 帧或 1–2 fps;音频 16kHz | 让现有模型可运行 | 非等算力;§4.2 |
| API | GPT-4o/Gemini,temperature 1.0 | 纳入强闭源模型 | GPT-4o 仅 2,100 题子集 |
闭源评测约 6 小时、开源约 4 小时(§4.2,p.6573),但无 GPU、批量、API 成本或重试率,不能据此比较端到端效率。
7. 数据集、指标与协议
MCQ 用准确率;AVSM 报 pair/full matching;AVDiar 用 DWER(越低越好);开放答案另报 GPT-4o 平均排名和 ROUGE-L。帧输入并不统一:Video-SALMONN 2 fps、VideoLLaMA2 16 帧、PandaGPT 10、Qwen2-VL 1 fps、LLaVA-Video 32、InternVL2 32、VILA1.5 6、VideoLLaVA 8、SALMONN 16kHz 音频(§4.2)。因此排名回答“默认配置能做到什么”,不能回答等 token/时延/显存下哪个架构更强。
8. 完整主结果矩阵
每格为 AV-Human/AV-Gemini 百分比,粗体为列最优。来源:表 3(p.6574 / PDF p.6)。
| 方法 | AIE | ACC | AEL | AVCM | AVOM | AVTM |
|---|---|---|---|---|---|---|
| Gemini 1.5 Pro | 90.02/94.70 | 50.85/39.99 | 83.43/73.32 | 74.05/83.13 | 74.79/76.62 | 81.22/83.68 |
| VideoLLaMA2 7B | 42.30/35.65 | 32.77/32.88 | 32.02/25.75 | 46.80/57.41 | 49.60/46.11 | 48.92/40.90 |
| video-SALMONN 13B | 52.45/32.86 | 33.33/30.17 | 36.05/32.48 | 34.47/41.42 | 30.25/31.42 | 39.95/36.21 |
| PandaGPT 13B | 24.94/30.82 | 25.00/29.13 | 26.16/30.61 | 24.31/27.54 | 26.28/28.44 | 25.77/26.36 |
| GPT-4o(视觉) | 60.37/61.43 | 35.00/31.14 | 33.14/34.57 | 51.81/55.71 | 59.34/55.43 | 70.69/61.71 |
| Qwen2-VL 7B | 59.21/53.48 | 41.67/33.18 | 34.88/39.44 | 62.90/65.08 | 55.85/57.01 | 69.74/58.37 |
| LLaVA-Video 7B | 54.19/55.77 | 39.05/30.62 | 24.83/38.17 | 62.83/62.53 | 61.87/58.21 | 62.94/60.04 |
| InternVL2 76B | 53.15/45.49 | 25.83/26.83 | 30.23/26.89 | 58.42/57.79 | 53.18/50.13 | 61.70/53.25 |
| InternVL2 8B | 44.52/37.70 | 30.00/25.24 | 29.07/26.58 | 49.25/53.54 | 47.43/43.38 | 53.19/43.69 |
| VILA1.5 8B | 41.72/38.28 | 28.33/26.78 | 28.49/36.61 | 53.30/62.38 | 46.41/47.77 | 46.34/46.64 |
| VideoLLaVA 7B | 34.73/27.97 | 15.00/19.10 | 22.67/17.30 | 36.67/42.36 | 34.09/35.86 | 35.93/29.69 |
| SALMONN 13B(音频) | 45.92/45.18 | 33.33/31.68 | 29.65/31.56 | 32.62/32.70 | 36.76/33.11 | 34.52/38.39 |
表 4(p.6574)总分:
| 方法 | AV-Human | AV-Gemini | Overall |
|---|---|---|---|
| Gemini 1.5 Pro | 78.34 | 75.21 | 75.67 |
| GPT-4o(视觉,2,100 子集) | 56.62 | 50.00 | 53.31 |
| Qwen2-VL 7B | 58.38 | 51.05 | 52.26 |
| LLaVA-Video 7B | 56.52 | 50.62 | 51.48 |
| InternVL2 76B | 52.62 | 43.29 | 44.72 |
| VILA1.5 8B | 44.48 | 43.05 | 43.27 |
| VideoLLaMA2 7B | 44.90 | 39.75 | 40.56 |
| InternVL2 8B | 45.90 | 38.31 | 39.47 |
| SALMONN 13B | 36.48 | 35.43 | 35.59 |
| video-SALMONN 13B | 38.33 | 34.08 | 34.74 |
| VideoLLaVA 7B | 33.14 | 28.70 | 29.37 |
| PandaGPT 13B | 25.38 | 28.83 | 28.31 |
Gemini 对第二名的 AV-Human 优势为 19.96 pp / 34.19%,AV-Gemini 为 24.16 pp / 47.33%(本报告复算)。后者不能全归因于感知,因为数据由 Gemini 生成并经人工修订。
开放任务表 6(p.6575):Gemini 的 AVSM pair/full/DWER 为 72.84/26.29/66.31,VideoLLaMA2 为 38.05/0.00/116.92,PandaGPT 为 39.87/1.22/155.94。即使最强模型 full matching 仅 26.29,细粒度全序列对应仍很难。表 7(p.6576)的 GPT 排名/ROUGE-L/MCQ:Gemini 3.331/.108/78.34,Qwen2-VL 2.233/.074/58.38,LLaVA-Video 2.217/.099/56.52。排序大致一致,但论文未报相关系数,ROUGE-L 最高也只有 .108。
9. 消融、敏感性、相变与统计
表 5(p.6575)同一 Gemini 在 Audio-Visual、Detailed Transcription、Visual-only、Audio-only 下为 78.34、69.23、62.78、54.10。AV 对视觉是 +15.56 pp / +24.78%,对音频 +24.24 pp / +44.81%,对详细转录 +9.11 pp / +13.16%。完整音频超过转录,提示韵律、音色、同步不可完全文字化;但没有反事实交互项,不能证明全部增益来自“推理”而非更多信息。
表 8(p.6577)循环文本 GPT-4o/Gemini:VideoVista 41.25/38.75,NExT-QA 23.22/26.37,Video-MME 16.03/13.05,AVUT 1.89/4.50。AVUT 相对随机低 23.11/20.50 pp,过滤很强;但 TemporalBench GPT-4o 从普通文本 65.42 升至循环 73.57,说明两列不能简单理解为循环必降,论文也无逐题误差分析。
论文未报告过滤模型、排列数、删除阈值、4 个演示或年份截止的敏感性,无法判断 4→24 排列或 4/4→3/4 阈值的纯度—规模相变。也未报告随机种子、标准差、bootstrap、McNemar、视频聚类标准误或标注者 kappa。同视频多题并非独立,相邻 1–2 pp 排名不能断言显著。
10. 相关工作技术链
Video-MME 以 900 视频、254 小时、2,700 QA 覆盖短中长视频并考虑字幕/音频(摘要与数据节);遗留缺口是音频并非每题必要且无系统文本过滤。AVUT 继承真实视频和模态对照,改成音频必要任务。
AVHBench 用 2,136 视频、5,816 QA、1,238 描述诊断跨模态幻觉(摘要与 §3);但问题文本仍可能泄露答案。AVUT 把“模态冲突”扩为“模态必要 + 文本不可猜”,传递按错误来源拆任务的思想。
LongVALE 有 8,411 长视频、549 小时、105,730 全模态事件和时间边界(摘要、表 1);它解决长期事件感知,却不以去捷径 MCQ 为中心。其边界设计传给 AEL/AVTM/AVSM,而 AVUT 选择 ≤2 分钟换取可控成本。
MUSIC-AVQA-R 诊断 MUSIC-AVQA 的语言/视觉偏置,用重构与反事实训练修正(NeurIPS 2024,§1–3);范围集中于音乐且与特定训练绑定。AVUT 将缺模态压力测试前移到数据发布阶段。
通用覆盖 ─ Video-MME ───────────────┐
跨模态错 ─ AVHBench ────────────────┤→ AVUT:音频必要 + 新视频 + 文本过滤
时间事件 ─ LongVALE ─ 长程边界 ──────┤ ├─ 六类 MCQ
偏置反事实 ─ MUSIC-AVQA-R ─ 缺模态 ─┘ └─ AVSM / AVDiar
↘ 尚未合流:长视频 × 全排列 × 等算力
| 工作 | 对象 | 音频必要 | 文本捷径控制 | 时间结构 | 遗留缺口 |
|---|---|---|---|---|---|
| Video-MME | 通用视频 QA | 部分 | 未系统过滤 | 多时长 | 音频可有可无 |
| AVHBench | 跨模态幻觉 | 是 | 非主机制 | 有限 | 无文本-only 清洗 |
| LongVALE | 长视频事件 | 是 | 非 MCQ 重点 | 强 | 无同构捷径实验 |
| MUSIC-AVQA-R | 音乐 AVQA 偏置 | 是 | 反事实重构 | 音乐事件 | 领域窄 |
| AVUT | 音频中心理解 | 是 | 四循环稳定过滤 | ≤2 分钟 | 单过滤器、非全排列 |
11. 贡献、复用与迁移
真正贡献有三点:把无视频文本模型测试变成发布门槛;把音频作用拆成抽取、计数、定位、对象/视觉/时间对应和说话人任务;分开 AV-Human 与 AV-Gemini,使生成风格可审计。最可复用的是“缺模态对照 × 选项排列不变性”,可迁移到医学 VQA(去影像)、图表问答(去图)、文档问答(去页面)、RAG(去证据)和机器人(去观测)。开放回答则需答案可恢复率、语义等价与反事实改写,不能机械套用四选一规则。
12. 论文自述限制
- 开源音频/音视频 LLM 较旧,可能弱于视觉模型(Limitations,p.6577),故榜单混合底座代际差。
- ≤2 分钟视频不能覆盖长程时间推理和持续时间理解(同页),不可外推到电影、会议、课程。
- 标注者可能偏好视觉、受第一语言影响,且仅系统研究四选一(同页),限制多语言与开放交互代表性。
13. 独立批判:因为 X,所以 Y
- [构造归因] 因为 9,875 个 AV-Gemini 题由 Gemini 生成,而 Gemini 在该分区 75.21、第二名 51.05,所以 24.16 pp 可能含生成器风格匹配,不能全归于感知。
- [过滤外推] 因为过滤只用 GPT-4o,而独立 Gemini 循环文本仍有 4.50%、高于 GPT-4o 的 1.89%,所以“无捷径”只是已测模型上的强压低。
- [排列覆盖] 因为只测 4 个循环、全排列有 24 个,所以非循环交换和答案长度组合捷径仍可能保留。
- [公平性] 因为输入从 6–32 帧、1–2 fps 到音频不等,GPT-4o 又只跑 2,100 题,所以表 4 不是等算力架构 head-to-head。
- [统计] 因为无方差、聚类区间或显著性且同视频多题,所以相邻 1–2 pp 排名不能视为稳定差异。
- [效度] 因为开放答案最高 ROUGE-L 仅 .108 且无 MCQ/开放任务相关系数,所以 MCQ 代表真实问答只有粗排序证据。
- [生成质量] 因为附录将需修订问题类型列为错误答案 40%、任务错配 20%、无关 15%、多解 15%、其他 10%,却不报其占 9,875 题的总发生率,所以无法量化审校成本和原始生成可靠性。
- [复现] 因为版权策略只发布 YouTube 链接,所以失效、地区限制、平台转码会改变可用样本;长期复现需要 URL 存活率和内容哈希。
14. 可操作开放挑战
理论
- 同一题池比较 1/4/8/24 个排列,固定 GPT-4o、Gemini、Qwen 三过滤器,报告保留率、独立文本准确率和 AV 准确率,画纯度—规模 Pareto。
- 对每题构造音频反事实、视频反事实、时间错位,比较 (f(A,V)-f(A,V')-f(A',V)+f(A',V')),分离信息叠加与交互。
- 以视频为 bootstrap 单位,做 Gemini/Qwen/LLaVA 配对区间和 McNemar,并按 18 领域做层级模型。
工程应用
- 统一 16 帧、同音频秒数、解码 token 与 GPU,报告 accuracy、p50/p95、显存、每千题成本,对比 audio-only、visual-only、early/late fusion。
- 每月扫描 YouTube URL,发布可用率、哈希变化、领域分布和排名漂移。
- 随机 500 个原始生成题,对比零审校、单审校、双人仲裁的准确率、歧义率、分钟/题和模型排名。
新兴方向
- 在 LongVALE 10–30 分钟片段构建同构任务,控制事件密度,直接比较 2 与 20 分钟的文本先验和长程记忆。
- 用 Gemini、GPT-4o、开源模型各生成、由不同模型过滤,做 3×3 矩阵量化 generator affinity。
- 同视频制作英语、中文和口音版本,对比原音频、翻译、ASR、静音输入,分层报告 DWER。
15. 近期联读
- Video-MME v2:更大规模视频评测,可检验音频是否仍是每题必要条件。
- VSTAT:强调视频时空与音频联合推理,适合验证 AVUT 的短时结论。
- HAVEN:高难音视频事件理解;应重点检查负样本是否经过缺模态压力测试。
- OmniSelect:研究全模态信息选择,与 AVUT 的“是否需要音频”互补。
- Joint Audio-Visual Reasoning Benchmark:把联合推理置于中心,适合做同预算交叉评测。
- LongVALE:长视频事件标注的重要参照,直接暴露 AVUT ≤2 分钟的外推边界。
16. 结论
AVUT 把“模型是否真的看和听”变成可执行的数据审计流程。最强证据是同一 Gemini 的 AV 78.34 对视觉 62.78(+15.56 pp),以及循环文本仅 1.89/4.50%;最大保留意见是生成器—榜首重合、单过滤器、排列不全、等算力与统计检验缺失。它是更接近“证据依赖”的 benchmark,但尚不是因果验证完成的多模态理解测量器。
脚注: 候选池保存在
candidates_2026-09-01.tsv;已更新
ml-report-index.md。所有精确数字来自实际读取的五篇论文
PDF,不从曲线臆读未标数字。HTML 已通过 Warm Editorial 结构验证器(0
error / 0 warning);环境未发现 /usr/bin/chromium 或
/opt/pw-browsers 中可执行 Chromium,故未虚称完成 Playwright
浅色、深色与移动端截图检查,改以模板响应式规则与静态结构验证兜底。
同一 Gemini 1.5 Pro 的模态消融
完整音视频超过视觉 15.56 pp,也超过详细转录 9.11 pp;纵轴为 MCQ 准确率(%)。