ML / AI DAILY DEEP PAPER · ICML 2025

DocVXQA:上下文解释,还是答案条件化的支持图?

充分性 × 最小性 × token interaction:解释更好看,也更需要 fidelity 审计

ICML 2025 · PMLR 267 2026-08-29 理论与可信 / 自解释学习

DocVXQA 将 PFL-DocVQA 遮罩 ANLS 从 ColPali 的 0.39 提至 0.66,但训练 prior 使用 ground-truth answer,尚未证明热图忠实反映原始预测机制。

0. 链接验证表与证据规则

以下 URL 均于 2026-08-29 实际访问。所有实验数字来自下载并逐页读取的 ICML/PMLR PDF;公开代码用于核对实现,网页摘要不用来填补论文未报告的数值。

资源 经验证链接 状态
ICML/PMLR PMLR 论文页 ICML 2025 主会,页 56549–56569
arXiv arXiv:2505.07496 v1,2025-05-12 12:30:16 UTC;无后续版本
OpenReview forum 已找到
代码 dali92002/DocVXQA 已公开,CC BY-NC 4.0;已逐文件审阅训练、数据、参数代码
权重 Google Drive 链接(由 README 提供) 链接存在;当前网络策略无法直接下载,故未校验文件哈希/大小
DocVQA 数据 官方数据页 50K 问题、12K+ 图像;需从 RRC portal 下载
PFL-DocVQA 官方竞赛仓库 可找到竞赛与数据说明;下载权限/完整数据包未在本次重取
项目页 未找到独立项目页 GitHub README 充当项目主页
视频/海报 ICML virtual 链接在 README 中,但当前环境不可达 不据此声称已观看视频

证据标签:表 1–5、图 3–4、式 (1)–(3) 均指核心 PDF;代码位置指 GitHub 主分支实际文件。论文没有多随机种子、训练方差、GPU/时长或能耗,本文保留相应小节并明确写“未报告”。

1. 候选池、排重与随机选择

按 America/Los_Angeles 当地日期执行 date +%u 得到 6(周六)。先读取 ml-report-index.md,排除 14 天内已覆盖的 SAE canonicality、LIMEFLDL、Alignment Potential 等解释/对齐主题。候选池共 24 篇,来自 ICML/NeurIPS proceedings、OpenReview、arXiv、Hugging Face Papers、Papers with Code 与 Semantic Scholar 的交叉检索:

# 候选 主题
1 Memorization Sinks 记忆隔离/隐私
2 OR-Bench 过度拒答评测
3 Just Enough Shifts / ACTOR 表征编辑与过拒
4 POROver 安全—有用性对齐
5 Weak-to-Strong Jailbreaking 弱到强越狱
6 Representations Shape Weak-to-Strong Generalization 泛化理论
7 Does Generation Require Memorization? 生成与记忆
8 On Volume Minimization in Conformal Regression conformal theory
9 Policy-labeled Preference Learning RLHF 可识别性
10 ELITE 多模态毒性评测
11 Be Confident MLLM 校准/过拟合
12 DocVXQA 自解释文档问答
13 One-Step Generalization Ratio 域泛化
14 Outlier Gradient Analysis 数据归因
15 Bi-perspective Splitting Defense 后门防御
16 X-Transfer Attacks 对抗迁移
17 Classifier Revelation in Strategic Classification 策略学习理论
18 Algorithms with Calibrated ML Predictions 校准理论
19 Susceptibility to Catastrophic Forgetting 遗忘预测
20 Representational Similarity as Robustness 鲁棒性
21 Data Attribution at Scale 数据归因系统
22 Certified Smoothing under Shift 认证鲁棒性
23 Mechanistic Unlearning and Editing 机器遗忘
24 Debate under Weak Judges 可扩展监督

执行 shuf -i 1-24 -n 1 得到 12。DocVXQA 为 ICML 2025 主会论文,公开了 21 页正文/附录、代码、权重入口与两套数据说明,故无需重抽。完整候选池另存于 candidates_2026-08-29.tsv

2. Motivation:答案位置不是答案理由

DocVQA 输入为文档图像 (X) 与问题 (q),输出字符串答案 (Y)。文档中的表格、标题、单位、列名、脚注和版式共同限定一个值的含义。例如问题是“总金额是多少”,只框出 $180,000 可能让模型重现答案,却没有说明它为何是 total、属于哪个表格或哪一列。核心论文第 1–3 页据此区分:

  • answer localization:找到答案文字出现的位置;
  • context-aware explanation:同时包含让答案语义成立的上下文;
  • representation efficiency:又不能把整页都涂亮。

现有 post-hoc 方法有两端问题。Gradient/attention 方法便宜,但可能噪声大或只追随模型注意力;perturbation 方法通常更接近因果干预,却需大量遮挡前向。定位监督又只适合答案可直接抄取的 extractive 样本。核心论文将矛盾量化为三指标:遮罩后重答的 Accuracy、ANLS 衡量充分性,被保留的 Pixel Ratio 衡量最小性(PDF 第 6 页,§4.1)。

痛点有直接数据:在 DocVQA 上,raw attention 阈值从 0.05 提到 0.50,Pixel Ratio 从 0.38 降至 0.04,但 Accuracy 从 0.34 跌到 0.03、ANLS 从 0.46 跌到 0.08;PFL-DocVQA 上相应 Accuracy 从 0.06 跌到 0.00(表 1,第 6 页)。这不是“阈值没调好”,而是单一 saliency 排序难以同时保留答案与语义上下文。

3. 论文故事线、关键假设与权衡

故事线分四步:

  1. 用 Pix2Struct 处理完整页面并生成答案,同时从 encoder token、decoder attention 与位置编码产生可学习 mask (M)。
  2. 把 (T=X\odot M) 当作 information bottleneck representation:遮罩区域应足够预测 (Y),又尽量小。
  3. 仅靠“可重答 + 稀疏”会退化成答案文字复印,因此用 ColPali 的 question/document 与 answer/document late-interaction heatmap 作为 token-interaction prior,要求 mask 包含更广上下文。
  4. 推理后把连通区域装入 bounding boxes,只保留 top-(k) 个,提高人可读性。

关键假设是:若同一 DocVQA backbone 在遮罩图上仍能生成相同答案,遮罩就“充分”;若面积小,解释就“最小”;若贴近 ColPali prior,就更 context-aware。这些是可操作的 surrogate,而非天然等价于 fidelity。论文选择的权衡是:牺牲未遮罩任务性能来换解释学习;在 PFL-DocVQA 中自家 unmasked 模型 Accuracy/ANLS 为 0.57/0.79,低于原 Pix2Struct 的 0.80/0.92(表 1),绝对下降 23/13 个百分点

4. 方程级形式化与实现流程

信息瓶颈原型(PDF 式 1,第 3–4 页):

[ \min_M \mathcal L_{IB}=\beta I(X;X\odot M)-I(X\odot M;Y). ]

第二项表示充分性。因 (H(Y)) 对固定标签为常数,论文用自回归 cross-entropy 近似:

[ \max I(X\odot M;Y)=H(Y)-H(Y|X\odot M) \Longleftrightarrow \min \mathcal L_{CE}(Y,\hat Y_M). ]

第一项并未按式 (1) 真正估计互信息。作者尝试 kernel-density MI 后称对高维图像和超参敏感、未取得预期结果(第 4–5 页,§3.3),最终换为 L1 sparsity 与 anisotropic total variation:

[ \mathcal L_{min}=\lambda_1|M|1+\lambda{tv}\sum_{i,j}(|M_{i+1,j}-M_{i,j}|+|M_{i,j+1}-M_{i,j}|). ]

ColPali prior 为 (M_p),最终目标(式 3,第 5 页)是:

[ \min \mathcal L_{VXQA}=\gamma,\mathrm{MSE}(M_p,M)+\beta\mathcal L_{min}(M)+\mathcal L_{CE}(Y,\hat Y_M). ]

但论文符号与公开实现命名存在混淆:PDF 表 4 写 (\gamma=0.5,\beta=5),代码 arg_utils.pygamma=0.5 是 minimality,beta=5 是 ColPali interaction;train.py 组合为 gamma * loss_mask + beta * loss_mask_colpali,与式 (3) 的字母位置相反。数值没有冲突,语义标签冲突会影响复现阅读。

训练:
  full image + question ──> Pix2Struct ──> answer loss (pass 1)
              │ decoder attention / encoder token / position
              └──────────> mask head ──> sigmoid relevance M
  question + image ──> ColPali heatmap ─┐
  GT answer + image ──> ColPali heatmap ├─ add ─> prior Mp
                                        └─ MSE(M,Mp)
  image ⊙ M ──> same backbone ──> answer loss (sufficiency)
  M ──> L1 + TV (minimality)

推理:question + image ─> M ─> connected components ─> top-k boxes
                         └─ masked image ─> answer

5. 机制与工程细节表

模块 输入/输出 作用 可复现细节 证据
Pix2Struct-base image+rendered question→answer 主 DocVQA backbone 282M;12 encoder + 12 decoder,hidden 768 附录 A.3,第 14 页
Mask head encoder feature、decoder attention、positional encoding→patch score 内生解释 MLP + sigmoid;论文未报层数/宽度 附录 A.2,第 14 页
Sufficiency masked image→answer CE 保证解释可用于回答 两次 forward;代码另含 full-image answer loss 式 2;train.py
Minimality mask→L1+TV 小且连续 lambda_reg=0.3 仅见代码;论文表 4 未列 §3.3;arg_utils.py
Token interaction Q-image 与 A-image ColPali maps→prior 补语义上下文 README 明确生成两张图并相加 §3.4;data.py:114–117
Postprocessing heatmap→connected boxes→top-k 人可读遮罩 默认 k=3;仅推理应用 §3.6;表 4–5
优化 全模型参数 联合训练 lr 1e-7、batch 5、AdamW、100 epochs/seed42 仅代码完整给出 表 4;arg_utils.py

论文正文第 4 页称 decoder 冻结,以保持文本预测一致;但公开默认配置 decoder_frozen=False,训练脚本只有该 flag 为 true 才设 requires_grad=False,随后 AdamW 接收 model.parameters()。因此按 README 的“直接训练”路径,decoder 默认会更新。除非作者运行时覆盖参数,论文配置与公开默认并不一致。

6. 数据集、基准与指标

  • DocVQA:官方页面给出约 50K 问题、12K+ 文档图像,答案是图中单段文本。论文用其评估常规文档解释。
  • PFL-DocVQA:invoice 领域,源工作由 4,968 个人工核验文档与新增 32,701 个标注文档构建(PFL 源论文 §4);DocVXQA 将其当作跨域/复杂布局测试,但未在正文报告本次具体 split 样本数。
  • Accuracy:exact/任务定义正确率,越高越好。
  • ANLS:normalized Levenshtein similarity,容忍 OCR/生成字符串轻微差异,越高越好。
  • Pixel Ratio:保留像素面积/整图面积,越低越简洁;但它不判断选中区域是否真因果、是否覆盖 GT evidence。
  • 人评:42 人×10 图,1–5 分 Context 与 Clarity;第二项偏好实验为 12 人×21 QA=252 trials,报告 exact binomial 类 CI 与 p 值。

7. 主结果完整数据矩阵

表 1 的全部可读数值如下。每个方法/阈值跨两数据集报告 Accuracy、ANLS、Pixel Ratio;粗体表示 explainable methods 中逐列最优点值,但 Pixel Ratio 的最小值往往来自效用崩溃,不应视为整体最优。

方法(阈值) Doc Acc Doc ANLS Doc Pixel↓ PFL Acc PFL ANLS PFL Pixel↓
Pix2Struct unmasked 0.56 0.68 1.00 0.80 0.92 1.00
Our model unmasked 0.51 0.65 1.00 0.57 0.79 1.00
Raw attention .05 0.34 0.46 0.38 0.06 0.13 0.27
Raw attention .10 0.20 0.32 0.20 0.04 0.10 0.17
Raw attention .25 0.07 0.13 0.08 0.01 0.04 0.09
Raw attention .50 0.03 0.08 0.04 0.00 0.01 0.05
Attention rollout .01 0.03 0.07 0.04 0.00 0.02 0.03
Attention rollout 1e-5 0.06 0.11 0.07 0.00 0.03 0.05
Grad-CAM .50 0.01 0.05 0.18 0.00 0.03 0.16
ColPali+Pix2Struct .50 0.38 0.50 0.23 0.28 0.39 0.18
DocVXQA .70 0.38 0.54 0.23 0.43 0.66 0.22
DocVXQA .80 0.30 0.46 0.11 0.33 0.54 0.13

同面积比较最有信息量。DocVQA 上 DocVXQA .70 与 ColPali .50 Pixel Ratio 都是 0.23:Accuracy 持平 0.38,ANLS 从 0.50→0.54,+4 个百分点、相对 +8%。PFL 上面积多 4pp(0.22 vs 0.18),Accuracy 0.28→0.43,+15pp / +53.6%;ANLS 0.39→0.66,+27pp / +69.2%。它显示 context prior 的跨域价值,但不是严格等面积。

在 PFL 更接近面积的对比中,DocVXQA .80 为 0.13 pixel,raw attention .10 为 0.17,前者反而少 4pp 面积,却将 Accuracy 0.04→0.33(+29pp)和 ANLS 0.10→0.54(+44pp)。这是主表最强证据。

同时,不应忽略上界损失:DocVQA 自家 unmasked 比原 Pix2Struct 低 5pp Accuracy/3pp ANLS;PFL 低 23pp/13pp。这说明联合 mask 训练没有维持原任务能力,解释质量改进伴随明显 backbone utility 代价。

PFL-DocVQA:上下文 prior 对遮罩后重答的影响

ANLS 越高越好;不同 operating point 的 Pixel Ratio 见正文表 1。

PFL-DocVQA ANLS 对比Raw attention 0.05 为 0.13,0.10 为 0.10,ColPali 为 0.39,DocVXQA 0.80 为 0.54,DocVXQA 0.70 为 0.66。00.350.70Raw .050.13Raw .100.10ColPali0.39DocVXQA .800.54DocVXQA .700.66
来源:DocVXQA 表 1(PDF p.6);悬停或键盘聚焦柱形显示精确值。

8. 消融、超参敏感性与“相变”

8.1 三目标消融

表 2(第 8 页)的行标签由正文解释确认:

目标 Accuracy ANLS Pixel Ratio
S(仅充分性) 0.51 0.65 1.00
S+M 0.19 0.36 0.02
S+M+TI 0.38 0.54 0.23

从 S 到 S+M,面积降 98%,但 Accuracy 下降 32pp、ANLS 下降 29pp:minimality 把模型推入“只抄答案字符”的塌缩区。加入 TI 后面积回升 21pp,却恢复 Accuracy 19pp、ANLS 18pp;说明 ColPali prior 不是微调项,而是避免退化的核心监督。

8.2 top-k 敏感性

表 5(第 14 页)给出 k=1/2/3/4/5/8/10/15/20/50/100。Accuracy 从 0.36 单调升至 0.45,ANLS 从 0.52 升至 0.60,Pixel Ratio 从 0.21 升至 0.40;k=3 为 0.38/0.54/0.24。论文称 k=3 “最佳折中”,但没有形式化效用函数或人评确定转折点。实际上 k=4 相对 k=3 仅多 1pp 面积,就多 1pp Accuracy/ANLS;因此不存在数据证明的锐利相变,只有作者偏好的 operating point。

8.3 权重敏感性

论文只报 (\gamma=0.5,\beta=5),未报告 grid、曲线或跨数据集调参流程;代码另有 lambda_reg=0.3alpha_1=2alpha_2=1、100 epochs、seed 42。故不能推出对 TI/minimality 权重鲁棒,也无法判断 0.23 面积是稳定 Pareto 解还是单点选择。

8.4 统计显著性

第二项人评给出 163/252 偏好 DocVXQA,即 64.7%,95% CI [58.4%,70.6%],p≪0.001(第 9 页),这是全文唯一明确显著性。主表、消融、阈值和第一项 42 人评分只给点估计或均值±离散度,没有随机种子/样本 bootstrap CI。表 3 的 ± 未说明是 SD 还是 SE,不能据此精确推断显著性。

9. 人类评价:真正证明了什么

表 3:

方法 Context↑ Clarity↑
Raw attention .25 2.90±0.48 2.75±0.42
Raw attention .50 2.26±0.54 2.34±0.60
ColPali+Pix2Struct 3.97±0.25 3.02±0.42
DocVXQA .70 4.49±0.26 3.56±0.41

相对 ColPali,Context +0.52(+13.1%),Clarity +0.54(+17.9%)。第二项直接偏好也显著。因此可以说“输出遮罩更受人喜欢、更便于凭遮罩回答”。但参与者已看到问题和 GT answer(第 8 页),任务是判断遮罩是否支持已知答案,而不是先盲答或诊断模型错误;所以不能把高分等价为“提升真实信任校准”。

10. 技术来源链:解决什么—遗留缺口—如何回应—设计如何传递

Pix2Struct(ICML 2023)

论文用 masked screenshot→simplified HTML 预训练和 variable-resolution patches 统一视觉语言任务(PDF 第 1–4 页),为 DocVQA 提供 OCR-free encoder-decoder。遗留缺口是输出答案但不暴露依据。DocVXQA保留 282M base 主干,添加 mask head 并做 masked second pass;传递是 截图解析表示→可学习 patch bottleneck

Grad-CAM(ICCV 2017)

论文以目标输出对卷积 feature map 的梯度加权生成定位图(PDF 第 2–4 页),优点是无需改训练;遗留缺口是自回归答案需要跨 token 聚合、梯度图不保证充分。DocVXQA把 explanation 直接纳入训练,并以遮罩后重答检验;传递是 输出相关性热图→可干预的输入 mask

Information Bottleneck attention / DIB-X 路线

IB self-attention把 mask 视为压缩表示,以保留标签信息、删除输入冗余;DIB-X进一步提出 minimal/sufficient/interactive 原则。遗留缺口是高维 MI 估计敏感,核心论文也承认 KDE-MI 未得到预期结果。DocVXQA用 L1+TV 和 answer CE 替代 MI,再以 ColPali prior实现 interactive;传递是 理论互信息目标→三个可优化 surrogate

ColPali(2024)

论文把 PaliGemma patch embedding 与 ColBERT 式 MaxSim late interaction结合,实现纯视觉文档检索(PDF 第 3–5 页)。其 query-token×image-patch similarity 天然可视化,但目标是检索,不是解释答案。DocVXQA把该图作为 teacher prior,并合并 question-image 与 answer-image;传递是 检索匹配图→上下文解释软监督

CoExVQA(2026,后续工作)

论文将证据选择、答案定位、基于 grounded region 解码串成 chain-of-explanation,试图让过程可验证(PDF 第 3–6 页)。它回应 DocVXQA 的 mask 将 evidence 与 answer localization混在一起的问题;关键转折是从单热图联合优化走向 阶段化、可核验的因果路径

                           ┌─ Grad-CAM / attention rollout:post-hoc 相关性
黑盒 DocVQA ─ Pix2Struct ─┤
                           └─ IB attention / DIB-X:minimal + sufficient mask
                                         │
ColBERT MaxSim ─ PaliGemma ─ ColPali:query-token × visual-patch interaction
                                         │ teacher prior(Q-image + A-image)
                                         ▼
                      DocVXQA:CE sufficiency + L1/TV minimality + TI context
                                  │
                                  ├─ 单 mask + top-k boxes:人可读但机制混合
                                  ▼
                CoExVQA:evidence selection → answer localization → grounded decoding

演进动力从“哪里相关”转向“哪些区域足以支撑答案”,再转向“解释步骤能否被逐段验证”。DocVXQA 的转折是将 retrieval prior 变成解释监督;其风险也正来自 teacher prior 不是 ground-truth reasoning。

工作 解释类型 是否改训练 是否要求答案/标签 fidelity 检验 核心缺口
Grad-CAM gradient saliency 目标输出 间接 自回归聚合脆弱
Attention rollout attention传播 attention≠因果
ColPali retrieval similarity 独立训练 query;DocVXQA baseline加 answer 遮罩重答 不是 QA 决策模型
DocVXQA learned mask 训练时 Q+A prior masked answer utility 同模型/teacher 循环
CoExVQA 分阶段 grounding evidence supervision/生成 grounded decoding 仍需更强因果测试

11. 真正贡献、复用设计与迁移潜力

  1. 解释作为可执行 bottleneck:热图不是展示层,而是必须支持第二次回答的输入。这个“explain→intervene→predict”结构可迁移到表格 QA、图表 QA、医疗报告和网页 agent。
  2. 把 minimality 与 sufficiency 分开报告:表 2 清楚暴露只追求稀疏会塌缩;比单一 IoU 或视觉漂亮更诚实。
  3. 跨模型 teacher prior:ColPali 检索表示补足 QA 模型缺失的上下文,是一种可复用的“外部语义先验→内部解释头”蒸馏。
  4. 人可读 postprocessing:connected components+top-k boxes 将 patch heatmap变成可操作证据单元,适合审阅界面;但应把 k 视为用户/SLO 可调参数。
  5. 迁移边界:Donut qualitative 结果说明接口可改造,但没有 Donut 定量表,故只能称架构兼容 proof-of-concept,不能称已证明 model-agnostic 性能。

12. 论文自述限制与独立批判

论文自述限制

  1. MI 估计失败:§3.3(第 4–5 页)明确 KDE-MI 对高维图像和超参敏感,未得到预期结果,最终目标是 IB-inspired surrogate,而非真正优化式 (1)。
  2. 泛化范围:结论段(第 9 页)把跨更多 DocVQA architecture/dataset 与优化 explanation—performance trade-off 列为未来工作。
  3. 主干性能损失:§4.3 承认同时处理 masked/clear images 使模型性能下降;PFL 的 23pp Accuracy 差距表明限制并不轻微。

独立批判(因为 X,所以 Y)

  1. [监督泄漏/定义] 因为 README 与 data.py:114–117 明确把 question-image 和 ground-truth answer-image ColPali maps 相加作为训练 target,所以 TI 学到的是“已知答案后哪里相关”;因此它不是纯 question-conditioned 自解释,部署到错误预测时可能仍解释训练答案模式。
  2. [忠实度循环] 因为 sufficiency 由同一类 Pix2Struct 在 masked image 上重答衡量,而 mask head又读 decoder attention,所以高 ANLS可能表示生成了对该模型友好的视觉 prompt;因此不能推出 mask忠实反映第一次 unmasked 推理的因果机制。
  3. [实现冲突] 因为 PDF 第 4 页称 decoder frozen,而代码默认 decoder_frozen=False 且优化全部参数,所以 README 默认复现路径与论文叙述不一致;因此无法确定表 1 来自哪种训练语义。
  4. [基线公平] 因为不同方法用不同阈值,ColPali baseline还处理 question+answer,而 raw/rollout/Grad-CAM 来自不同信息与模型路径,所以逐行“最佳”混合了方法、信息预算和面积预算;因此应补等 Pixel Ratio Pareto/AUC,而非挑 operating points。
  5. [任务能力代价] 因为 PFL unmasked Accuracy 从 0.80 降到 0.57、ANLS 从 0.92 降到 0.79,所以解释训练损害核心 QA 泛化;因此不能只用 explainable methods 子表宣称总体更可靠。
  6. [人评效度] 因为 42 人研究让参与者看到 GT answer,且只用 10 images,所以它测“遮罩是否看起来支持已知答案”,不是解释能否帮助发现错误或改善 calibrated trust;因此“fosters trust”超出直接证据。
  7. [统计/复现] 因为主表无多种子、CI,论文也未报 GPU/时长,公开代码虽 seed42/100 epochs 却含本地绝对路径,所以无法估算稳定性和完整复现成本;因此 4pp ANLS 小优势需谨慎。
  8. [后处理归因] 因为图 4 声称阈值≥0.7 时 postprocessing 同时提升效用并降面积,却没有给完整数字表,而表 5 又显示 k 增大时效用单调上升,所以无法分离 learned mask 与 box heuristic 的贡献。

13. 开放挑战:可操作 head-to-head 实验

理论

  • 因果 fidelity:DocVXQA、Grad-CAM、ColPali、CoExVQA 在相同 Pixel Ratio 下做 comprehensiveness/sufficiency、mask randomization、模型参数 randomization、counterfactual evidence swap;比较热图相关性是否随原模型决策真正变化。
  • 无答案 prior:分别训练 Q-only、A-only、Q+A、GT evidence box teacher 四版,测试正确与错误预测的 fidelity;量化 answer-conditioned supervision 贡献和错误解释风险。
  • Pareto 最优性:对 β/γ/k 联合 sweep,报告 Accuracy/ANLS–Pixel Ratio 曲线与 hypervolume,使用独立 validation 选点;head-to-head 比较是否支配 raw/ColPali 曲线。

工程应用

  • 错误诊断人评:盲化 GT answer,让参与者在“模型正确/错误各半”的样本上决定是否采纳答案;比较无解释、DocVXQA、ColPali、CoExVQA 的人机联合准确率、误信率、阅读时间。
  • 跨骨干定量:Pix2Struct、Donut、Qwen-VL/InternVL 在 DocVQA/PFL/InfographicVQA 上用同一 evidence metric;报告增加参数、两次 forward 延迟、GPU memory 与吞吐。
  • 可复现配置:冻结/不冻结 decoder 2×2(含 encoder)、固定 seed≥5,报告平均±SD;验证公开默认与论文叙述哪一个产生表 1。

新兴方向

  • 隐私解释冲突:在 PFL-DocVQA 中比较高精解释是否泄露 provider/logo/PII;DocVXQA vs DP-trained backbone,联合测 ANLS、membership inference AUC、explanation privacy leakage。
  • 多页 agent 文档推理:单页 mask扩展到 page retrieval→region evidence→answer,比较 token budget 和证据召回;要求每个 answer 可追溯到页/框,并测试跨页数值推理。
  • 可验证结构解释:把 boxes转换为 OCR span/表格 cell/键值关系图,比较像素热图与结构化 rationale 在人工审计、反事实编辑、自动证据评分上的差异。

14. 近期工作雷达(经验证链接)

  1. CoExVQA(2026):把 evidence selection、answer localization、grounded decoding 串成显式链,直接回应 DocVXQA 单热图混合不同推理阶段的问题。
  2. BBox DocVQA(2025):论文卡报告 3.6K 文档、32K QA 与 bounding-box grounding,为解释评价从“同模型重答”转向 GT evidence IoU/recall 提供数据基础;arXiv 聚合元数据在本次访问中出现标题冲突,故只把 Hugging Face 论文卡列为可核验入口。
  3. DocMIA(2025):展示 DocVQA 的 document-level membership inference 风险;解释图可能成为新的攻击面,应与 privacy audit 联合。
  4. ColPali(2024):patch-level late interaction仍是视觉文档检索和弱解释 prior 的关键基座,但检索相关性不能自动等价为回答理由。
  5. PFL-DocVQA / Privacy-Aware DocVQA:把文档问答置于联邦与差分隐私环境;DocVXQA只使用其数据域,没有评价解释对隐私的影响。
  6. DocVQA 2026 competition:覆盖八类文档并强调多模态 reasoning,可用于检验 DocVXQA 是否只对 extractive 单页答案有效。

15. 结论

DocVXQA最可信的发现是:在 PFL-DocVQA 上,约相近遮罩预算下,DocVXQA .70 相对 ColPali 将 Accuracy 从 0.28 提到 0.43、ANLS 从 0.39 提到 0.66;人类直接偏好达到 64.7%(163/252,p≪0.001)。它证明“只框答案”不足,语义上下文 prior 能显著改善解释的可用性。

但其最重要的未解问题同样清楚:ColPali teacher在训练中看到了 ground-truth answer,fidelity 又由同类模型 masked re-answer 衡量;公开默认 decoder 设置与论文叙述冲突,并且 PFL unmasked Accuracy 损失 23pp。因此更准确的定位是:一种效果强的 context-support mask 学习方法,而不是已经验证的原模型因果解释器。


生成与验证脚注:核心论文及 ColPali、Pix2Struct、Grad-CAM、CoExVQA PDF 均已下载阅读;所有报告链接均实际访问,无法直取的权重/视频已明确标注。HTML 使用 Warm Editorial 模板、自包含 CSS/JS、双主题与响应式表格,并已通过结构验证器。当前环境未发现 /usr/bin/chromium/opt/pw-browsers,因此无法诚实完成 Playwright 的浅色、深色与移动端截图;已改用响应式 CSS、DOM 特征与依赖检查,未虚称完成浏览器渲染。ml-report-index.md 已追加本次条目。