0. 链接验证表与证据规则
以下 URL 均于 2026-08-29 实际访问。所有实验数字来自下载并逐页读取的 ICML/PMLR PDF;公开代码用于核对实现,网页摘要不用来填补论文未报告的数值。
| 资源 | 经验证链接 | 状态 |
|---|---|---|
| ICML/PMLR | PMLR 论文页 | ICML 2025 主会,页 56549–56569 |
| arXiv | arXiv:2505.07496 | v1,2025-05-12 12:30:16 UTC;无后续版本 |
| OpenReview | forum | 已找到 |
| 代码 | dali92002/DocVXQA | 已公开,CC BY-NC 4.0;已逐文件审阅训练、数据、参数代码 |
| 权重 | Google Drive 链接(由 README 提供) | 链接存在;当前网络策略无法直接下载,故未校验文件哈希/大小 |
| DocVQA 数据 | 官方数据页 | 50K 问题、12K+ 图像;需从 RRC portal 下载 |
| PFL-DocVQA | 官方竞赛仓库 | 可找到竞赛与数据说明;下载权限/完整数据包未在本次重取 |
| 项目页 | 未找到独立项目页 | GitHub README 充当项目主页 |
| 视频/海报 | ICML virtual 链接在 README 中,但当前环境不可达 | 不据此声称已观看视频 |
证据标签:表 1–5、图 3–4、式 (1)–(3) 均指核心 PDF;代码位置指 GitHub 主分支实际文件。论文没有多随机种子、训练方差、GPU/时长或能耗,本文保留相应小节并明确写“未报告”。
1. 候选池、排重与随机选择
按 America/Los_Angeles 当地日期执行 date +%u 得到
6(周六)。先读取 ml-report-index.md,排除
14 天内已覆盖的 SAE canonicality、LIMEFLDL、Alignment Potential
等解释/对齐主题。候选池共 24 篇,来自 ICML/NeurIPS
proceedings、OpenReview、arXiv、Hugging Face Papers、Papers with Code 与
Semantic Scholar 的交叉检索:
| # | 候选 | 主题 |
|---|---|---|
| 1 | Memorization Sinks | 记忆隔离/隐私 |
| 2 | OR-Bench | 过度拒答评测 |
| 3 | Just Enough Shifts / ACTOR | 表征编辑与过拒 |
| 4 | POROver | 安全—有用性对齐 |
| 5 | Weak-to-Strong Jailbreaking | 弱到强越狱 |
| 6 | Representations Shape Weak-to-Strong Generalization | 泛化理论 |
| 7 | Does Generation Require Memorization? | 生成与记忆 |
| 8 | On Volume Minimization in Conformal Regression | conformal theory |
| 9 | Policy-labeled Preference Learning | RLHF 可识别性 |
| 10 | ELITE | 多模态毒性评测 |
| 11 | Be Confident | MLLM 校准/过拟合 |
| 12 | DocVXQA | 自解释文档问答 |
| 13 | One-Step Generalization Ratio | 域泛化 |
| 14 | Outlier Gradient Analysis | 数据归因 |
| 15 | Bi-perspective Splitting Defense | 后门防御 |
| 16 | X-Transfer Attacks | 对抗迁移 |
| 17 | Classifier Revelation in Strategic Classification | 策略学习理论 |
| 18 | Algorithms with Calibrated ML Predictions | 校准理论 |
| 19 | Susceptibility to Catastrophic Forgetting | 遗忘预测 |
| 20 | Representational Similarity as Robustness | 鲁棒性 |
| 21 | Data Attribution at Scale | 数据归因系统 |
| 22 | Certified Smoothing under Shift | 认证鲁棒性 |
| 23 | Mechanistic Unlearning and Editing | 机器遗忘 |
| 24 | Debate under Weak Judges | 可扩展监督 |
执行 shuf -i 1-24 -n 1 得到 12。DocVXQA
为 ICML 2025 主会论文,公开了 21
页正文/附录、代码、权重入口与两套数据说明,故无需重抽。完整候选池另存于
candidates_2026-08-29.tsv。
2. Motivation:答案位置不是答案理由
DocVQA 输入为文档图像 (X) 与问题 (q),输出字符串答案
(Y)。文档中的表格、标题、单位、列名、脚注和版式共同限定一个值的含义。例如问题是“总金额是多少”,只框出
$180,000 可能让模型重现答案,却没有说明它为何是
total、属于哪个表格或哪一列。核心论文第 1–3 页据此区分:
- answer localization:找到答案文字出现的位置;
- context-aware explanation:同时包含让答案语义成立的上下文;
- representation efficiency:又不能把整页都涂亮。
现有 post-hoc 方法有两端问题。Gradient/attention 方法便宜,但可能噪声大或只追随模型注意力;perturbation 方法通常更接近因果干预,却需大量遮挡前向。定位监督又只适合答案可直接抄取的 extractive 样本。核心论文将矛盾量化为三指标:遮罩后重答的 Accuracy、ANLS 衡量充分性,被保留的 Pixel Ratio 衡量最小性(PDF 第 6 页,§4.1)。
痛点有直接数据:在 DocVQA 上,raw attention 阈值从 0.05 提到 0.50,Pixel Ratio 从 0.38 降至 0.04,但 Accuracy 从 0.34 跌到 0.03、ANLS 从 0.46 跌到 0.08;PFL-DocVQA 上相应 Accuracy 从 0.06 跌到 0.00(表 1,第 6 页)。这不是“阈值没调好”,而是单一 saliency 排序难以同时保留答案与语义上下文。
3. 论文故事线、关键假设与权衡
故事线分四步:
- 用 Pix2Struct 处理完整页面并生成答案,同时从 encoder token、decoder attention 与位置编码产生可学习 mask (M)。
- 把 (T=X\odot M) 当作 information bottleneck representation:遮罩区域应足够预测 (Y),又尽量小。
- 仅靠“可重答 + 稀疏”会退化成答案文字复印,因此用 ColPali 的 question/document 与 answer/document late-interaction heatmap 作为 token-interaction prior,要求 mask 包含更广上下文。
- 推理后把连通区域装入 bounding boxes,只保留 top-(k) 个,提高人可读性。
关键假设是:若同一 DocVQA backbone 在遮罩图上仍能生成相同答案,遮罩就“充分”;若面积小,解释就“最小”;若贴近 ColPali prior,就更 context-aware。这些是可操作的 surrogate,而非天然等价于 fidelity。论文选择的权衡是:牺牲未遮罩任务性能来换解释学习;在 PFL-DocVQA 中自家 unmasked 模型 Accuracy/ANLS 为 0.57/0.79,低于原 Pix2Struct 的 0.80/0.92(表 1),绝对下降 23/13 个百分点。
4. 方程级形式化与实现流程
信息瓶颈原型(PDF 式 1,第 3–4 页):
[ \min_M \mathcal L_{IB}=\beta I(X;X\odot M)-I(X\odot M;Y). ]
第二项表示充分性。因 (H(Y)) 对固定标签为常数,论文用自回归 cross-entropy 近似:
[ \max I(X\odot M;Y)=H(Y)-H(Y|X\odot M) \Longleftrightarrow \min \mathcal L_{CE}(Y,\hat Y_M). ]
第一项并未按式 (1) 真正估计互信息。作者尝试 kernel-density MI 后称对高维图像和超参敏感、未取得预期结果(第 4–5 页,§3.3),最终换为 L1 sparsity 与 anisotropic total variation:
[ \mathcal L_{min}=\lambda_1|M|1+\lambda{tv}\sum_{i,j}(|M_{i+1,j}-M_{i,j}|+|M_{i,j+1}-M_{i,j}|). ]
ColPali prior 为 (M_p),最终目标(式 3,第 5 页)是:
[ \min \mathcal L_{VXQA}=\gamma,\mathrm{MSE}(M_p,M)+\beta\mathcal L_{min}(M)+\mathcal L_{CE}(Y,\hat Y_M). ]
但论文符号与公开实现命名存在混淆:PDF 表 4 写
(\gamma=0.5,\beta=5),代码 arg_utils.py 中
gamma=0.5 是 minimality,beta=5 是 ColPali
interaction;train.py 组合为
gamma * loss_mask + beta * loss_mask_colpali,与式 (3)
的字母位置相反。数值没有冲突,语义标签冲突会影响复现阅读。
训练:
full image + question ──> Pix2Struct ──> answer loss (pass 1)
│ decoder attention / encoder token / position
└──────────> mask head ──> sigmoid relevance M
question + image ──> ColPali heatmap ─┐
GT answer + image ──> ColPali heatmap ├─ add ─> prior Mp
└─ MSE(M,Mp)
image ⊙ M ──> same backbone ──> answer loss (sufficiency)
M ──> L1 + TV (minimality)
推理:question + image ─> M ─> connected components ─> top-k boxes
└─ masked image ─> answer
5. 机制与工程细节表
| 模块 | 输入/输出 | 作用 | 可复现细节 | 证据 |
|---|---|---|---|---|
| Pix2Struct-base | image+rendered question→answer | 主 DocVQA backbone | 282M;12 encoder + 12 decoder,hidden 768 | 附录 A.3,第 14 页 |
| Mask head | encoder feature、decoder attention、positional encoding→patch score | 内生解释 | MLP + sigmoid;论文未报层数/宽度 | 附录 A.2,第 14 页 |
| Sufficiency | masked image→answer CE | 保证解释可用于回答 | 两次 forward;代码另含 full-image answer loss | 式 2;train.py |
| Minimality | mask→L1+TV | 小且连续 | lambda_reg=0.3 仅见代码;论文表 4 未列 |
§3.3;arg_utils.py |
| Token interaction | Q-image 与 A-image ColPali maps→prior | 补语义上下文 | README 明确生成两张图并相加 | §3.4;data.py:114–117 |
| Postprocessing | heatmap→connected boxes→top-k | 人可读遮罩 | 默认 k=3;仅推理应用 | §3.6;表 4–5 |
| 优化 | 全模型参数 | 联合训练 | lr 1e-7、batch 5、AdamW、100 epochs/seed42 仅代码完整给出 | 表 4;arg_utils.py |
论文正文第 4 页称 decoder 冻结,以保持文本预测一致;但公开默认配置
decoder_frozen=False,训练脚本只有该 flag 为 true 才设
requires_grad=False,随后 AdamW 接收
model.parameters()。因此按 README 的“直接训练”路径,decoder
默认会更新。除非作者运行时覆盖参数,论文配置与公开默认并不一致。
6. 数据集、基准与指标
- DocVQA:官方页面给出约 50K 问题、12K+ 文档图像,答案是图中单段文本。论文用其评估常规文档解释。
- PFL-DocVQA:invoice 领域,源工作由 4,968 个人工核验文档与新增 32,701 个标注文档构建(PFL 源论文 §4);DocVXQA 将其当作跨域/复杂布局测试,但未在正文报告本次具体 split 样本数。
- Accuracy:exact/任务定义正确率,越高越好。
- ANLS:normalized Levenshtein similarity,容忍 OCR/生成字符串轻微差异,越高越好。
- Pixel Ratio:保留像素面积/整图面积,越低越简洁;但它不判断选中区域是否真因果、是否覆盖 GT evidence。
- 人评:42 人×10 图,1–5 分 Context 与 Clarity;第二项偏好实验为 12 人×21 QA=252 trials,报告 exact binomial 类 CI 与 p 值。
7. 主结果完整数据矩阵
表 1 的全部可读数值如下。每个方法/阈值跨两数据集报告 Accuracy、ANLS、Pixel Ratio;粗体表示 explainable methods 中逐列最优点值,但 Pixel Ratio 的最小值往往来自效用崩溃,不应视为整体最优。
| 方法(阈值) | Doc Acc | Doc ANLS | Doc Pixel↓ | PFL Acc | PFL ANLS | PFL Pixel↓ |
|---|---|---|---|---|---|---|
| Pix2Struct unmasked | 0.56 | 0.68 | 1.00 | 0.80 | 0.92 | 1.00 |
| Our model unmasked | 0.51 | 0.65 | 1.00 | 0.57 | 0.79 | 1.00 |
| Raw attention .05 | 0.34 | 0.46 | 0.38 | 0.06 | 0.13 | 0.27 |
| Raw attention .10 | 0.20 | 0.32 | 0.20 | 0.04 | 0.10 | 0.17 |
| Raw attention .25 | 0.07 | 0.13 | 0.08 | 0.01 | 0.04 | 0.09 |
| Raw attention .50 | 0.03 | 0.08 | 0.04 | 0.00 | 0.01 | 0.05 |
| Attention rollout .01 | 0.03 | 0.07 | 0.04 | 0.00 | 0.02 | 0.03 |
| Attention rollout 1e-5 | 0.06 | 0.11 | 0.07 | 0.00 | 0.03 | 0.05 |
| Grad-CAM .50 | 0.01 | 0.05 | 0.18 | 0.00 | 0.03 | 0.16 |
| ColPali+Pix2Struct .50 | 0.38 | 0.50 | 0.23 | 0.28 | 0.39 | 0.18 |
| DocVXQA .70 | 0.38 | 0.54 | 0.23 | 0.43 | 0.66 | 0.22 |
| DocVXQA .80 | 0.30 | 0.46 | 0.11 | 0.33 | 0.54 | 0.13 |
同面积比较最有信息量。DocVQA 上 DocVXQA .70 与 ColPali .50 Pixel Ratio 都是 0.23:Accuracy 持平 0.38,ANLS 从 0.50→0.54,+4 个百分点、相对 +8%。PFL 上面积多 4pp(0.22 vs 0.18),Accuracy 0.28→0.43,+15pp / +53.6%;ANLS 0.39→0.66,+27pp / +69.2%。它显示 context prior 的跨域价值,但不是严格等面积。
在 PFL 更接近面积的对比中,DocVXQA .80 为 0.13 pixel,raw attention .10 为 0.17,前者反而少 4pp 面积,却将 Accuracy 0.04→0.33(+29pp)和 ANLS 0.10→0.54(+44pp)。这是主表最强证据。
同时,不应忽略上界损失:DocVQA 自家 unmasked 比原 Pix2Struct 低 5pp Accuracy/3pp ANLS;PFL 低 23pp/13pp。这说明联合 mask 训练没有维持原任务能力,解释质量改进伴随明显 backbone utility 代价。
PFL-DocVQA:上下文 prior 对遮罩后重答的影响
ANLS 越高越好;不同 operating point 的 Pixel Ratio 见正文表 1。
8. 消融、超参敏感性与“相变”
8.1 三目标消融
表 2(第 8 页)的行标签由正文解释确认:
| 目标 | Accuracy | ANLS | Pixel Ratio |
|---|---|---|---|
| S(仅充分性) | 0.51 | 0.65 | 1.00 |
| S+M | 0.19 | 0.36 | 0.02 |
| S+M+TI | 0.38 | 0.54 | 0.23 |
从 S 到 S+M,面积降 98%,但 Accuracy 下降 32pp、ANLS 下降 29pp:minimality 把模型推入“只抄答案字符”的塌缩区。加入 TI 后面积回升 21pp,却恢复 Accuracy 19pp、ANLS 18pp;说明 ColPali prior 不是微调项,而是避免退化的核心监督。
8.2 top-k 敏感性
表 5(第 14 页)给出 k=1/2/3/4/5/8/10/15/20/50/100。Accuracy 从 0.36 单调升至 0.45,ANLS 从 0.52 升至 0.60,Pixel Ratio 从 0.21 升至 0.40;k=3 为 0.38/0.54/0.24。论文称 k=3 “最佳折中”,但没有形式化效用函数或人评确定转折点。实际上 k=4 相对 k=3 仅多 1pp 面积,就多 1pp Accuracy/ANLS;因此不存在数据证明的锐利相变,只有作者偏好的 operating point。
8.3 权重敏感性
论文只报 (\gamma=0.5,\beta=5),未报告
grid、曲线或跨数据集调参流程;代码另有
lambda_reg=0.3、alpha_1=2、alpha_2=1、100
epochs、seed 42。故不能推出对 TI/minimality 权重鲁棒,也无法判断 0.23
面积是稳定 Pareto 解还是单点选择。
8.4 统计显著性
第二项人评给出 163/252 偏好 DocVXQA,即 64.7%,95% CI [58.4%,70.6%],p≪0.001(第 9 页),这是全文唯一明确显著性。主表、消融、阈值和第一项 42 人评分只给点估计或均值±离散度,没有随机种子/样本 bootstrap CI。表 3 的 ± 未说明是 SD 还是 SE,不能据此精确推断显著性。
9. 人类评价:真正证明了什么
表 3:
| 方法 | Context↑ | Clarity↑ |
|---|---|---|
| Raw attention .25 | 2.90±0.48 | 2.75±0.42 |
| Raw attention .50 | 2.26±0.54 | 2.34±0.60 |
| ColPali+Pix2Struct | 3.97±0.25 | 3.02±0.42 |
| DocVXQA .70 | 4.49±0.26 | 3.56±0.41 |
相对 ColPali,Context +0.52(+13.1%),Clarity +0.54(+17.9%)。第二项直接偏好也显著。因此可以说“输出遮罩更受人喜欢、更便于凭遮罩回答”。但参与者已看到问题和 GT answer(第 8 页),任务是判断遮罩是否支持已知答案,而不是先盲答或诊断模型错误;所以不能把高分等价为“提升真实信任校准”。
10. 技术来源链:解决什么—遗留缺口—如何回应—设计如何传递
Pix2Struct(ICML 2023)
论文用 masked screenshot→simplified HTML 预训练和 variable-resolution patches 统一视觉语言任务(PDF 第 1–4 页),为 DocVQA 提供 OCR-free encoder-decoder。遗留缺口是输出答案但不暴露依据。DocVXQA保留 282M base 主干,添加 mask head 并做 masked second pass;传递是 截图解析表示→可学习 patch bottleneck。
Grad-CAM(ICCV 2017)
论文以目标输出对卷积 feature map 的梯度加权生成定位图(PDF 第 2–4 页),优点是无需改训练;遗留缺口是自回归答案需要跨 token 聚合、梯度图不保证充分。DocVXQA把 explanation 直接纳入训练,并以遮罩后重答检验;传递是 输出相关性热图→可干预的输入 mask。
Information Bottleneck attention / DIB-X 路线
IB self-attention把 mask 视为压缩表示,以保留标签信息、删除输入冗余;DIB-X进一步提出 minimal/sufficient/interactive 原则。遗留缺口是高维 MI 估计敏感,核心论文也承认 KDE-MI 未得到预期结果。DocVXQA用 L1+TV 和 answer CE 替代 MI,再以 ColPali prior实现 interactive;传递是 理论互信息目标→三个可优化 surrogate。
ColPali(2024)
论文把 PaliGemma patch embedding 与 ColBERT 式 MaxSim late interaction结合,实现纯视觉文档检索(PDF 第 3–5 页)。其 query-token×image-patch similarity 天然可视化,但目标是检索,不是解释答案。DocVXQA把该图作为 teacher prior,并合并 question-image 与 answer-image;传递是 检索匹配图→上下文解释软监督。
CoExVQA(2026,后续工作)
论文将证据选择、答案定位、基于 grounded region 解码串成 chain-of-explanation,试图让过程可验证(PDF 第 3–6 页)。它回应 DocVXQA 的 mask 将 evidence 与 answer localization混在一起的问题;关键转折是从单热图联合优化走向 阶段化、可核验的因果路径。
┌─ Grad-CAM / attention rollout:post-hoc 相关性
黑盒 DocVQA ─ Pix2Struct ─┤
└─ IB attention / DIB-X:minimal + sufficient mask
│
ColBERT MaxSim ─ PaliGemma ─ ColPali:query-token × visual-patch interaction
│ teacher prior(Q-image + A-image)
▼
DocVXQA:CE sufficiency + L1/TV minimality + TI context
│
├─ 单 mask + top-k boxes:人可读但机制混合
▼
CoExVQA:evidence selection → answer localization → grounded decoding
演进动力从“哪里相关”转向“哪些区域足以支撑答案”,再转向“解释步骤能否被逐段验证”。DocVXQA 的转折是将 retrieval prior 变成解释监督;其风险也正来自 teacher prior 不是 ground-truth reasoning。
| 工作 | 解释类型 | 是否改训练 | 是否要求答案/标签 | fidelity 检验 | 核心缺口 |
|---|---|---|---|---|---|
| Grad-CAM | gradient saliency | 否 | 目标输出 | 间接 | 自回归聚合脆弱 |
| Attention rollout | attention传播 | 否 | 否 | 无 | attention≠因果 |
| ColPali | retrieval similarity | 独立训练 | query;DocVXQA baseline加 answer | 遮罩重答 | 不是 QA 决策模型 |
| DocVXQA | learned mask | 是 | 训练时 Q+A prior | masked answer utility | 同模型/teacher 循环 |
| CoExVQA | 分阶段 grounding | 是 | evidence supervision/生成 | grounded decoding | 仍需更强因果测试 |
11. 真正贡献、复用设计与迁移潜力
- 解释作为可执行 bottleneck:热图不是展示层,而是必须支持第二次回答的输入。这个“explain→intervene→predict”结构可迁移到表格 QA、图表 QA、医疗报告和网页 agent。
- 把 minimality 与 sufficiency 分开报告:表 2 清楚暴露只追求稀疏会塌缩;比单一 IoU 或视觉漂亮更诚实。
- 跨模型 teacher prior:ColPali 检索表示补足 QA 模型缺失的上下文,是一种可复用的“外部语义先验→内部解释头”蒸馏。
- 人可读 postprocessing:connected components+top-k boxes 将 patch heatmap变成可操作证据单元,适合审阅界面;但应把 k 视为用户/SLO 可调参数。
- 迁移边界:Donut qualitative 结果说明接口可改造,但没有 Donut 定量表,故只能称架构兼容 proof-of-concept,不能称已证明 model-agnostic 性能。
12. 论文自述限制与独立批判
论文自述限制
- MI 估计失败:§3.3(第 4–5 页)明确 KDE-MI 对高维图像和超参敏感,未得到预期结果,最终目标是 IB-inspired surrogate,而非真正优化式 (1)。
- 泛化范围:结论段(第 9 页)把跨更多 DocVQA architecture/dataset 与优化 explanation—performance trade-off 列为未来工作。
- 主干性能损失:§4.3 承认同时处理 masked/clear images 使模型性能下降;PFL 的 23pp Accuracy 差距表明限制并不轻微。
独立批判(因为 X,所以 Y)
- [监督泄漏/定义] 因为 README 与
data.py:114–117明确把 question-image 和 ground-truth answer-image ColPali maps 相加作为训练 target,所以 TI 学到的是“已知答案后哪里相关”;因此它不是纯 question-conditioned 自解释,部署到错误预测时可能仍解释训练答案模式。 - [忠实度循环] 因为 sufficiency 由同一类 Pix2Struct 在 masked image 上重答衡量,而 mask head又读 decoder attention,所以高 ANLS可能表示生成了对该模型友好的视觉 prompt;因此不能推出 mask忠实反映第一次 unmasked 推理的因果机制。
- [实现冲突] 因为 PDF 第 4 页称 decoder
frozen,而代码默认
decoder_frozen=False且优化全部参数,所以 README 默认复现路径与论文叙述不一致;因此无法确定表 1 来自哪种训练语义。 - [基线公平] 因为不同方法用不同阈值,ColPali baseline还处理 question+answer,而 raw/rollout/Grad-CAM 来自不同信息与模型路径,所以逐行“最佳”混合了方法、信息预算和面积预算;因此应补等 Pixel Ratio Pareto/AUC,而非挑 operating points。
- [任务能力代价] 因为 PFL unmasked Accuracy 从 0.80 降到 0.57、ANLS 从 0.92 降到 0.79,所以解释训练损害核心 QA 泛化;因此不能只用 explainable methods 子表宣称总体更可靠。
- [人评效度] 因为 42 人研究让参与者看到 GT answer,且只用 10 images,所以它测“遮罩是否看起来支持已知答案”,不是解释能否帮助发现错误或改善 calibrated trust;因此“fosters trust”超出直接证据。
- [统计/复现] 因为主表无多种子、CI,论文也未报 GPU/时长,公开代码虽 seed42/100 epochs 却含本地绝对路径,所以无法估算稳定性和完整复现成本;因此 4pp ANLS 小优势需谨慎。
- [后处理归因] 因为图 4 声称阈值≥0.7 时 postprocessing 同时提升效用并降面积,却没有给完整数字表,而表 5 又显示 k 增大时效用单调上升,所以无法分离 learned mask 与 box heuristic 的贡献。
13. 开放挑战:可操作 head-to-head 实验
理论
- 因果 fidelity:DocVXQA、Grad-CAM、ColPali、CoExVQA 在相同 Pixel Ratio 下做 comprehensiveness/sufficiency、mask randomization、模型参数 randomization、counterfactual evidence swap;比较热图相关性是否随原模型决策真正变化。
- 无答案 prior:分别训练 Q-only、A-only、Q+A、GT evidence box teacher 四版,测试正确与错误预测的 fidelity;量化 answer-conditioned supervision 贡献和错误解释风险。
- Pareto 最优性:对 β/γ/k 联合 sweep,报告 Accuracy/ANLS–Pixel Ratio 曲线与 hypervolume,使用独立 validation 选点;head-to-head 比较是否支配 raw/ColPali 曲线。
工程应用
- 错误诊断人评:盲化 GT answer,让参与者在“模型正确/错误各半”的样本上决定是否采纳答案;比较无解释、DocVXQA、ColPali、CoExVQA 的人机联合准确率、误信率、阅读时间。
- 跨骨干定量:Pix2Struct、Donut、Qwen-VL/InternVL 在 DocVQA/PFL/InfographicVQA 上用同一 evidence metric;报告增加参数、两次 forward 延迟、GPU memory 与吞吐。
- 可复现配置:冻结/不冻结 decoder 2×2(含 encoder)、固定 seed≥5,报告平均±SD;验证公开默认与论文叙述哪一个产生表 1。
新兴方向
- 隐私解释冲突:在 PFL-DocVQA 中比较高精解释是否泄露 provider/logo/PII;DocVXQA vs DP-trained backbone,联合测 ANLS、membership inference AUC、explanation privacy leakage。
- 多页 agent 文档推理:单页 mask扩展到 page retrieval→region evidence→answer,比较 token budget 和证据召回;要求每个 answer 可追溯到页/框,并测试跨页数值推理。
- 可验证结构解释:把 boxes转换为 OCR span/表格 cell/键值关系图,比较像素热图与结构化 rationale 在人工审计、反事实编辑、自动证据评分上的差异。
14. 近期工作雷达(经验证链接)
- CoExVQA(2026):把 evidence selection、answer localization、grounded decoding 串成显式链,直接回应 DocVXQA 单热图混合不同推理阶段的问题。
- BBox DocVQA(2025):论文卡报告 3.6K 文档、32K QA 与 bounding-box grounding,为解释评价从“同模型重答”转向 GT evidence IoU/recall 提供数据基础;arXiv 聚合元数据在本次访问中出现标题冲突,故只把 Hugging Face 论文卡列为可核验入口。
- DocMIA(2025):展示 DocVQA 的 document-level membership inference 风险;解释图可能成为新的攻击面,应与 privacy audit 联合。
- ColPali(2024):patch-level late interaction仍是视觉文档检索和弱解释 prior 的关键基座,但检索相关性不能自动等价为回答理由。
- PFL-DocVQA / Privacy-Aware DocVQA:把文档问答置于联邦与差分隐私环境;DocVXQA只使用其数据域,没有评价解释对隐私的影响。
- DocVQA 2026 competition:覆盖八类文档并强调多模态 reasoning,可用于检验 DocVXQA 是否只对 extractive 单页答案有效。
15. 结论
DocVXQA最可信的发现是:在 PFL-DocVQA 上,约相近遮罩预算下,DocVXQA .70 相对 ColPali 将 Accuracy 从 0.28 提到 0.43、ANLS 从 0.39 提到 0.66;人类直接偏好达到 64.7%(163/252,p≪0.001)。它证明“只框答案”不足,语义上下文 prior 能显著改善解释的可用性。
但其最重要的未解问题同样清楚:ColPali teacher在训练中看到了 ground-truth answer,fidelity 又由同类模型 masked re-answer 衡量;公开默认 decoder 设置与论文叙述冲突,并且 PFL unmasked Accuracy 损失 23pp。因此更准确的定位是:一种效果强的 context-support mask 学习方法,而不是已经验证的原模型因果解释器。
生成与验证脚注:核心论文及
ColPali、Pix2Struct、Grad-CAM、CoExVQA PDF
均已下载阅读;所有报告链接均实际访问,无法直取的权重/视频已明确标注。HTML
使用 Warm Editorial 模板、自包含
CSS/JS、双主题与响应式表格,并已通过结构验证器。当前环境未发现
/usr/bin/chromium 或
/opt/pw-browsers,因此无法诚实完成 Playwright
的浅色、深色与移动端截图;已改用响应式 CSS、DOM
特征与依赖检查,未虚称完成浏览器渲染。ml-report-index.md
已追加本次条目。