EMNLP 2025 MAIN · VISION & MULTIMODAL

AVUT:当视频问答不能再靠读题猜答案

从文本捷径过滤,到音频是否真的提供独立证据

EMNLP 2025 Main 2026-09-01 音视频理解与基准可信度

四循环过滤将 AVUT 的文本-only 命中压至 1.89%/4.50%,而同一 Gemini 的完整音视频比视觉高 15.56 pp;但生成器、过滤器与评测协议仍留下归因风险。

一句话核心定位: AVUT 用音频中心任务、新视频与四次循环选项过滤,主动切断“只读问题和选项就能答对”的捷径;同一 Gemini 1.5 Pro 的完整音视频准确率比视觉单模态高 15.56 个百分点,但独立文本模型在过滤后仍有 4.50% 循环命中,故“无捷径”应理解为强抑制而非绝对消除。

1. 链接验证表与证据边界

所有链接均实际访问。页码指 EMNLP 最终 PDF 印刷页码,必要时附 PDF 页序。论文最初名为 ACVUBench,正式版改名 AVUT,二者不是两篇工作。

对象 会议/正式页 arXiv(版本、日期) 代码 数据/权重 项目页/视频
AVUT(核心) EMNLP 2025 Main, pp.6569–6587 2503.19951v3, 2025-09-28;v1 首投 2025-03-25 GitHub HF 数据集;模型权重不适用 未找到独立项目页/视频
Video-MME CVPR 2025 2405.21075v4 GitHub 仓库提供数据说明 项目页
AVHBench ICLR 2025 2410.18325 GitHub 仓库提供基准 项目页
LongVALE CVPR 2025 PDF 2411.19772 GitHub HF 视频未找到
MUSIC-AVQA-R NeurIPS 2024 2404.12020 OpenReview 所列资源 基于 MUSIC-AVQA 重构 项目页未找到

“论文原报”只指 PDF 正文/表格可读数值;“本报告复算”只做减法和除法。AVUT 未报告置信区间、标准差、显著性或标注者一致性,故不写“显著优于”。

2. 候选池、排重与随机选择

先查 ml-report-index.md,排除最近 14 天的 MMedPO、Visual Graph Arena、Q-VDiT、DocVXQA 等主题。通过 ACL Anthology、arXiv、OpenReview、会议页及公开仓库交叉收集 24 篇:UniVLG;Do VLMs Really Understand Visual Language;ELITE;DEFAME;Closed-form Adversarial Robustness;MTSTRec;CoreMatching;Agent Reviewers;RoG World Models;video-SALMONN-o1;Hidden Life of Tokens;Compositional Tabular QA;Orthus;Be Confident;VL-PRM;MMix;RobustVLA;VSTAT;HAVEN;MVU-Eval;Video-MMLU;MT-Video-Bench;MMIU;AVUT。执行 shuf -i 1-24 -n 124。初版题名 ACVUBench,经核验为 EMNLP 2025 Main 最终版 AVUT,资料充分,重抽 0 次

3. Motivation:榜单可能测到“读题能力”

AVUT 表 8(p.6577 / PDF p.9)显示,无视频时 GPT-4o 在 VideoVista、TemporalBench、NExT-QA 分别有 68.00%、65.42%、47.57%,Gemini 为 62.63%、59.37%、48.95%,远超四选一随机 25%。所以视频问答准确率会混入问题措辞、答案长度、选项位置和数据来源先验。

AVUT 表 1(p.6570 / PDF p.2)含 2,662 视频、11,609 QA、8 任务,平均 67.8 秒;AV-Human 为 698 视频/1,734 QA,AV-Gemini 为 1,964 视频/9,875 QA。视频主要采于 2023 年后、英语、≤2 分钟,覆盖 18 个音频中心领域。六个 MCQ 为音频信息抽取 AIE、计数 ACC、事件定位 AEL、音视对应 AVCM、对象匹配 AVOM、时间匹配 AVTM;开放任务为片段匹配 AVSM 与说话人日志 AVDiar。AVDiar 有 260 视频、平均 3.59 位说话者(§3.2,p.6572)。

4. 故事线、假设与权衡

论文先采集新视频;人工构建 AV-Human;Gemini 1.5 Pro 每个 MCQ 任务看 4 个示例生成 AV-Gemini;9,875 个生成 QA 全部经人工审校;再让 GPT-4o 不看视频、在四个循环排列上答题,全对则删除。核心假设是:跨排列稳定正确意味着文本捷径;GPT-4o 能暴露大部分捷径;同一模型完整输入对单模态的增益近似反映模态价值。代价是过滤可能过拟合 GPT-4o、生成器风格写进数据、短视频牺牲长程理解。

5. 形式化、伪代码与流程

设题目 (q=(x_a,x_v,t,O,y)),循环置换集 (C_4={ABCD,BCDA,CDAB,DABC})。过滤指示量: [ S_m(q)=\prod_{\pi\in C_4}\mathbf1[m(t,\pi(O))=\pi(y)]. ] 若 (S_{GPT4o}(q)=1) 则删除。独立均匀猜测四连中的理想概率为 ((1/4)^4=0.390625%),但模型回答不独立,且只覆盖 (4!/4=6) 分之一的排列,不能把它当真实假阳性率。MCQ 为微平均准确率。表 5 的同模型模态增益为: [ \Delta_{AV-V}=78.34-62.78=15.56\text{ pp},\quad 15.56/62.78=24.78%. ]

新视频 ─┬─ 人工:698 视频 → 1,734 QA
        └─ Gemini + 4 demos/任务:1,964 视频 → 9,875 QA
                         ↓ 全量人工审校
六类 MCQ → GPT-4o 无视频 × 四循环选项 → 删除稳定文本命中
AVSM/AVDiar ──────────────────────────→ 开放任务评测
                         ↓
12 个模型,多种帧/音频预算 → MCQ、匹配、DWER、GPT 排名、ROUGE-L

6. 关键机制与工程细节

机制 实现 作用 代价/来源
新数据 主要 2023 年后、英语、≤2 分钟 降低旧榜记忆 无商业训练集审计;§3.1
双轨构建 人工 AV-Human + Gemini AV-Gemini 质量锚点与规模 生成器也是榜首;§3.2–3.3
全量审校 9,875 机器题均审查 去错误、多解、错配 无一致性/成本;§3.3
循环过滤 GPT-4o 文本-only,4 次全对删除 压低内容与位置捷径 单一模型、4/24 排列;§3.4
模态消融 同一 Gemini 比 AV/转录/V/A 隔离模态贡献 仅一个闭源模型;表 5
异构适配 6–32 帧或 1–2 fps;音频 16kHz 让现有模型可运行 非等算力;§4.2
API GPT-4o/Gemini,temperature 1.0 纳入强闭源模型 GPT-4o 仅 2,100 题子集

闭源评测约 6 小时、开源约 4 小时(§4.2,p.6573),但无 GPU、批量、API 成本或重试率,不能据此比较端到端效率。

7. 数据集、指标与协议

MCQ 用准确率;AVSM 报 pair/full matching;AVDiar 用 DWER(越低越好);开放答案另报 GPT-4o 平均排名和 ROUGE-L。帧输入并不统一:Video-SALMONN 2 fps、VideoLLaMA2 16 帧、PandaGPT 10、Qwen2-VL 1 fps、LLaVA-Video 32、InternVL2 32、VILA1.5 6、VideoLLaVA 8、SALMONN 16kHz 音频(§4.2)。因此排名回答“默认配置能做到什么”,不能回答等 token/时延/显存下哪个架构更强。

8. 完整主结果矩阵

每格为 AV-Human/AV-Gemini 百分比,粗体为列最优。来源:表 3(p.6574 / PDF p.6)。

方法 AIE ACC AEL AVCM AVOM AVTM
Gemini 1.5 Pro 90.02/94.70 50.85/39.99 83.43/73.32 74.05/83.13 74.79/76.62 81.22/83.68
VideoLLaMA2 7B 42.30/35.65 32.77/32.88 32.02/25.75 46.80/57.41 49.60/46.11 48.92/40.90
video-SALMONN 13B 52.45/32.86 33.33/30.17 36.05/32.48 34.47/41.42 30.25/31.42 39.95/36.21
PandaGPT 13B 24.94/30.82 25.00/29.13 26.16/30.61 24.31/27.54 26.28/28.44 25.77/26.36
GPT-4o(视觉) 60.37/61.43 35.00/31.14 33.14/34.57 51.81/55.71 59.34/55.43 70.69/61.71
Qwen2-VL 7B 59.21/53.48 41.67/33.18 34.88/39.44 62.90/65.08 55.85/57.01 69.74/58.37
LLaVA-Video 7B 54.19/55.77 39.05/30.62 24.83/38.17 62.83/62.53 61.87/58.21 62.94/60.04
InternVL2 76B 53.15/45.49 25.83/26.83 30.23/26.89 58.42/57.79 53.18/50.13 61.70/53.25
InternVL2 8B 44.52/37.70 30.00/25.24 29.07/26.58 49.25/53.54 47.43/43.38 53.19/43.69
VILA1.5 8B 41.72/38.28 28.33/26.78 28.49/36.61 53.30/62.38 46.41/47.77 46.34/46.64
VideoLLaVA 7B 34.73/27.97 15.00/19.10 22.67/17.30 36.67/42.36 34.09/35.86 35.93/29.69
SALMONN 13B(音频) 45.92/45.18 33.33/31.68 29.65/31.56 32.62/32.70 36.76/33.11 34.52/38.39

表 4(p.6574)总分:

方法 AV-Human AV-Gemini Overall
Gemini 1.5 Pro 78.34 75.21 75.67
GPT-4o(视觉,2,100 子集) 56.62 50.00 53.31
Qwen2-VL 7B 58.38 51.05 52.26
LLaVA-Video 7B 56.52 50.62 51.48
InternVL2 76B 52.62 43.29 44.72
VILA1.5 8B 44.48 43.05 43.27
VideoLLaMA2 7B 44.90 39.75 40.56
InternVL2 8B 45.90 38.31 39.47
SALMONN 13B 36.48 35.43 35.59
video-SALMONN 13B 38.33 34.08 34.74
VideoLLaVA 7B 33.14 28.70 29.37
PandaGPT 13B 25.38 28.83 28.31

Gemini 对第二名的 AV-Human 优势为 19.96 pp / 34.19%,AV-Gemini 为 24.16 pp / 47.33%(本报告复算)。后者不能全归因于感知,因为数据由 Gemini 生成并经人工修订。

开放任务表 6(p.6575):Gemini 的 AVSM pair/full/DWER 为 72.84/26.29/66.31,VideoLLaMA2 为 38.05/0.00/116.92,PandaGPT 为 39.87/1.22/155.94。即使最强模型 full matching 仅 26.29,细粒度全序列对应仍很难。表 7(p.6576)的 GPT 排名/ROUGE-L/MCQ:Gemini 3.331/.108/78.34,Qwen2-VL 2.233/.074/58.38,LLaVA-Video 2.217/.099/56.52。排序大致一致,但论文未报相关系数,ROUGE-L 最高也只有 .108。

9. 消融、敏感性、相变与统计

表 5(p.6575)同一 Gemini 在 Audio-Visual、Detailed Transcription、Visual-only、Audio-only 下为 78.34、69.23、62.78、54.10。AV 对视觉是 +15.56 pp / +24.78%,对音频 +24.24 pp / +44.81%,对详细转录 +9.11 pp / +13.16%。完整音频超过转录,提示韵律、音色、同步不可完全文字化;但没有反事实交互项,不能证明全部增益来自“推理”而非更多信息。

表 8(p.6577)循环文本 GPT-4o/Gemini:VideoVista 41.25/38.75,NExT-QA 23.22/26.37,Video-MME 16.03/13.05,AVUT 1.89/4.50。AVUT 相对随机低 23.11/20.50 pp,过滤很强;但 TemporalBench GPT-4o 从普通文本 65.42 升至循环 73.57,说明两列不能简单理解为循环必降,论文也无逐题误差分析。

论文未报告过滤模型、排列数、删除阈值、4 个演示或年份截止的敏感性,无法判断 4→24 排列或 4/4→3/4 阈值的纯度—规模相变。也未报告随机种子、标准差、bootstrap、McNemar、视频聚类标准误或标注者 kappa。同视频多题并非独立,相邻 1–2 pp 排名不能断言显著。

10. 相关工作技术链

Video-MME 以 900 视频、254 小时、2,700 QA 覆盖短中长视频并考虑字幕/音频(摘要与数据节);遗留缺口是音频并非每题必要且无系统文本过滤。AVUT 继承真实视频和模态对照,改成音频必要任务。

AVHBench 用 2,136 视频、5,816 QA、1,238 描述诊断跨模态幻觉(摘要与 §3);但问题文本仍可能泄露答案。AVUT 把“模态冲突”扩为“模态必要 + 文本不可猜”,传递按错误来源拆任务的思想。

LongVALE 有 8,411 长视频、549 小时、105,730 全模态事件和时间边界(摘要、表 1);它解决长期事件感知,却不以去捷径 MCQ 为中心。其边界设计传给 AEL/AVTM/AVSM,而 AVUT 选择 ≤2 分钟换取可控成本。

MUSIC-AVQA-R 诊断 MUSIC-AVQA 的语言/视觉偏置,用重构与反事实训练修正(NeurIPS 2024,§1–3);范围集中于音乐且与特定训练绑定。AVUT 将缺模态压力测试前移到数据发布阶段。

通用覆盖 ─ Video-MME ───────────────┐
跨模态错 ─ AVHBench ────────────────┤→ AVUT:音频必要 + 新视频 + 文本过滤
时间事件 ─ LongVALE ─ 长程边界 ──────┤       ├─ 六类 MCQ
偏置反事实 ─ MUSIC-AVQA-R ─ 缺模态 ─┘       └─ AVSM / AVDiar
                         ↘ 尚未合流:长视频 × 全排列 × 等算力
工作 对象 音频必要 文本捷径控制 时间结构 遗留缺口
Video-MME 通用视频 QA 部分 未系统过滤 多时长 音频可有可无
AVHBench 跨模态幻觉 非主机制 有限 无文本-only 清洗
LongVALE 长视频事件 非 MCQ 重点 无同构捷径实验
MUSIC-AVQA-R 音乐 AVQA 偏置 反事实重构 音乐事件 领域窄
AVUT 音频中心理解 四循环稳定过滤 ≤2 分钟 单过滤器、非全排列

11. 贡献、复用与迁移

真正贡献有三点:把无视频文本模型测试变成发布门槛;把音频作用拆成抽取、计数、定位、对象/视觉/时间对应和说话人任务;分开 AV-Human 与 AV-Gemini,使生成风格可审计。最可复用的是“缺模态对照 × 选项排列不变性”,可迁移到医学 VQA(去影像)、图表问答(去图)、文档问答(去页面)、RAG(去证据)和机器人(去观测)。开放回答则需答案可恢复率、语义等价与反事实改写,不能机械套用四选一规则。

12. 论文自述限制

  1. 开源音频/音视频 LLM 较旧,可能弱于视觉模型(Limitations,p.6577),故榜单混合底座代际差。
  2. ≤2 分钟视频不能覆盖长程时间推理和持续时间理解(同页),不可外推到电影、会议、课程。
  3. 标注者可能偏好视觉、受第一语言影响,且仅系统研究四选一(同页),限制多语言与开放交互代表性。

13. 独立批判:因为 X,所以 Y

  1. [构造归因] 因为 9,875 个 AV-Gemini 题由 Gemini 生成,而 Gemini 在该分区 75.21、第二名 51.05,所以 24.16 pp 可能含生成器风格匹配,不能全归于感知。
  2. [过滤外推] 因为过滤只用 GPT-4o,而独立 Gemini 循环文本仍有 4.50%、高于 GPT-4o 的 1.89%,所以“无捷径”只是已测模型上的强压低。
  3. [排列覆盖] 因为只测 4 个循环、全排列有 24 个,所以非循环交换和答案长度组合捷径仍可能保留。
  4. [公平性] 因为输入从 6–32 帧、1–2 fps 到音频不等,GPT-4o 又只跑 2,100 题,所以表 4 不是等算力架构 head-to-head。
  5. [统计] 因为无方差、聚类区间或显著性且同视频多题,所以相邻 1–2 pp 排名不能视为稳定差异。
  6. [效度] 因为开放答案最高 ROUGE-L 仅 .108 且无 MCQ/开放任务相关系数,所以 MCQ 代表真实问答只有粗排序证据。
  7. [生成质量] 因为附录将需修订问题类型列为错误答案 40%、任务错配 20%、无关 15%、多解 15%、其他 10%,却不报其占 9,875 题的总发生率,所以无法量化审校成本和原始生成可靠性。
  8. [复现] 因为版权策略只发布 YouTube 链接,所以失效、地区限制、平台转码会改变可用样本;长期复现需要 URL 存活率和内容哈希。

14. 可操作开放挑战

理论

  • 同一题池比较 1/4/8/24 个排列,固定 GPT-4o、Gemini、Qwen 三过滤器,报告保留率、独立文本准确率和 AV 准确率,画纯度—规模 Pareto。
  • 对每题构造音频反事实、视频反事实、时间错位,比较 (f(A,V)-f(A,V')-f(A',V)+f(A',V')),分离信息叠加与交互。
  • 以视频为 bootstrap 单位,做 Gemini/Qwen/LLaVA 配对区间和 McNemar,并按 18 领域做层级模型。

工程应用

  • 统一 16 帧、同音频秒数、解码 token 与 GPU,报告 accuracy、p50/p95、显存、每千题成本,对比 audio-only、visual-only、early/late fusion。
  • 每月扫描 YouTube URL,发布可用率、哈希变化、领域分布和排名漂移。
  • 随机 500 个原始生成题,对比零审校、单审校、双人仲裁的准确率、歧义率、分钟/题和模型排名。

新兴方向

  • 在 LongVALE 10–30 分钟片段构建同构任务,控制事件密度,直接比较 2 与 20 分钟的文本先验和长程记忆。
  • 用 Gemini、GPT-4o、开源模型各生成、由不同模型过滤,做 3×3 矩阵量化 generator affinity。
  • 同视频制作英语、中文和口音版本,对比原音频、翻译、ASR、静音输入,分层报告 DWER。

15. 近期联读

  1. Video-MME v2:更大规模视频评测,可检验音频是否仍是每题必要条件。
  2. VSTAT:强调视频时空与音频联合推理,适合验证 AVUT 的短时结论。
  3. HAVEN:高难音视频事件理解;应重点检查负样本是否经过缺模态压力测试。
  4. OmniSelect:研究全模态信息选择,与 AVUT 的“是否需要音频”互补。
  5. Joint Audio-Visual Reasoning Benchmark:把联合推理置于中心,适合做同预算交叉评测。
  6. LongVALE:长视频事件标注的重要参照,直接暴露 AVUT ≤2 分钟的外推边界。

16. 结论

AVUT 把“模型是否真的看和听”变成可执行的数据审计流程。最强证据是同一 Gemini 的 AV 78.34 对视觉 62.78(+15.56 pp),以及循环文本仅 1.89/4.50%;最大保留意见是生成器—榜首重合、单过滤器、排列不全、等算力与统计检验缺失。它是更接近“证据依赖”的 benchmark,但尚不是因果验证完成的多模态理解测量器。


脚注: 候选池保存在 candidates_2026-09-01.tsv;已更新 ml-report-index.md。所有精确数字来自实际读取的五篇论文 PDF,不从曲线臆读未标数字。HTML 已通过 Warm Editorial 结构验证器(0 error / 0 warning);环境未发现 /usr/bin/chromium/opt/pw-browsers 中可执行 Chromium,故未虚称完成 Playwright 浅色、深色与移动端截图检查,改以模板响应式规则与静态结构验证兜底。

同一 Gemini 1.5 Pro 的模态消融

完整音视频超过视觉 15.56 pp,也超过详细转录 9.11 pp;纵轴为 MCQ 准确率(%)。

Gemini 模态消融准确率音视频 78.34,详细转录 69.23,视觉 62.78,音频 54.10。020406080音视频详细转录视觉音频
来源:AVUT 表 5,p.6575(PDF p.7)。仅比较同一模型,避免把模型代际差误作模态贡献。