视觉与多模态 · ICML 2025

Visual Graph Arena 深度报告

模型看见了线条,却没有稳定恢复线条背后的图

ICML 2025 / PMLR 267 2026-08-25 Visual reasoning · Graph invariance · MLLM evaluation

VGA 证明当前模型尚未形成布局稳健的像素到图结构映射;但测试泄漏与感知—推理未解耦,使“pseudo-intelligence”仍是待验证解释。

日期:2026-08-25
今日领域:视觉与多模态
核心论文Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
发表:ICML 2025,PMLR 267:2081–2113
随机选择记录:候选池共 24 篇;执行 shuf -i 1-24 -n 1 抽中第 7 篇;正式全文、项目页与数据入口均可访问,无重抽。

一句话核心定位:VGA 不再问模型“能否在一张图上答对图论题”,而是把同一图结构换一种布局,检验模型能否从像素中恢复与布局无关的关系不变量;结果显示,人类准确率为 88.2%–100%,而视觉模型在同构任务上接近随机,最好的通用视觉模型在最大无弦环上也只有 36.3%。

0. 链接验证表

下列链接均于 2026-08-25 实际访问。VGA 项目页提供数据下载与读取示例,但未找到完整训练/评测仓库,因此“代码”列不把网页中的 loader snippet 误标为完整复现代码。

论文 会议主页 / 正式出版 arXiv(版本日期) Code 仓库 数据集 / 权重 项目主页 / 视频
Visual Graph Arena(核心) ICML 2025 / PMLROpenReview 2506.06242v1,2025-06-06 完整训练代码未找到网页读取示例 直接下载 ZIPZenodo DOI 项目主页;视频未找到
CLEVR CVPR 2017 1612.06890v1,2016-12-20 数据生成代码 CLEVR 数据页 同数据页;视频未找到
FigureQA 正式会议主页未找到 1710.07300v2,2018-02-22 官方仓库baseline 仓库提供下载说明 项目主页未找到
Visual Concept-Metaconcept Learning NeurIPS 2019 2002.01464v1,2020-02-04 未找到 使用 CLEVR / GQA / CUB 项目主页未找到
VisionGraph 正式会议主页未找到 2405.04950v1,2024-05-08 官方仓库 仓库内 benchmark 项目主页未找到

0.1 候选池(24 篇)

候选均为 ICML 2025 主会论文,处于最近 12 个月优先范围;已排除 2026-08-18 深度覆盖的 MMedPO 及医疗偏好优化主题。

  1. GAPrompt: Geometry-Aware Point Cloud Prompt for 3D Vision Model
  2. Vision Graph Prompting via Semantic Low-Rank Decomposition
  3. Direct Motion Models for Assessing Generated Videos
  4. Aligning Multimodal Representations through an Information Bottleneck
  5. Raptor: Scalable Train-Free Embeddings for 3D Medical Volumes
  6. FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
  7. Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
  8. Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in VLMs
  9. SMART-PC: Skeletal Model Adaptation for Robust Test-Time Training in Point Clouds
  10. Impossible Videos
  11. Whitened CLIP as a Likelihood Surrogate of Images and Captions
  12. Rethinking Point Cloud Data Augmentation: Topologically Consistent Deformation
  13. Point Cloud Dataset Distillation
  14. DEFAME: Dynamic Evidence-based Fact-checking with Multimodal Experts
  15. From Local Details to Global Context: Advancing VLMs with Attention-Based Selection
  16. Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
  17. From Thousands to Billions: 3D Visual Language Grounding via Render-Supervised Distillation
  18. EFDTR: Learnable Elliptical Fourier Descriptor Transformer for Instance Segmentation
  19. AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
  20. CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning
  21. Open-Det: An Efficient Learning Framework for Open-Ended Detection
  22. SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval
  23. LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in MLLMs
  24. A Closer Look at Multimodal Representation Collapse

1. 核心论文深度解析

1.1 Motivation:把“答题能力”拆成视觉解析与结构不变量

传统 VQA benchmark 往往把识别、语言理解、常识与推理同时揉进一个分数。模型答错时,很难判断它没看清对象、没理解问题、不会推理,还是被数据偏差误导。VGA 选择极小的无向图作为受控对象:图只含 8–9 个节点,边与节点清晰,人类可以直接检查;同时,同一个抽象图可以被 random、Kamada–Kawai 或 planar layout 画成外观截然不同的图像。这样,标签只由图结构决定,视觉形式成为可控干预变量。

论文把目标称为 conceptualization:底层概念保持不变、表征形式发生变化时,模型仍能识别并操作同一概念。这个问题比一般的 OOD 更窄。颜色、背景或拍摄域变化未必改变对象关系;而 VGA 直接改变节点坐标、边长、角度、交叉与整体轮廓,同时保持邻接关系或图论性质。理想模型应忽略 layout 的表面差异,恢复一个等价的关系表示。

痛点的量化非常直接。核心论文表 2 中,人类在八个报告列上达到 88.2%–100%;视觉模型在两个同构任务上几乎全部被标为 FAIL,唯一例外是 SigLIP 在 easy isomorphism 上 54.4%,仍只比二分类随机水平高 4.4 pp。最大无弦环上,最强 ConvNeXt 只有 36.3%,比人类 88.2% 低 51.9 pp。这不是“大模型还差一点”,而是结构不变量没有从像素表征中稳定出现。

为什么值得解决?流程图、化学结构、逻辑电路、电气图、分子骨架与科学示意图都存在“同一关系、多种画法”。若模型主要依赖轮廓和局部纹理,它可能在熟悉模板上表现很好,却在换布局、换绘图软件或换工程规范时失效。VGA 的价值不是模拟所有真实图表,而是提供一个最小反例:连 8–9 节点图的布局变化都不能跨越,就很难声称模型已经具备通用的视觉结构理解。

1.2 论文故事线:从受控干预到行为异常

论文的故事并不是提出新网络,而是构建一条诊断链。

第一步:选择结构明确、可枚举的视觉对象。 作者从 8、9 节点 connected graph 集合中生成图像;附录 B 报告原始集合含 11,117 个 8 节点图和 261,080 个 9 节点图。图论算法可以给出确定标签,避免主观标注。

第二步:让标签依赖结构,让 train/test 在布局上分离。 六项任务覆盖 isomorphism、path、cycle 三个概念,每个概念分两种难度或问题形式。模型不能仅靠训练布局的整体形状记忆标签,至少在设计意图上必须学习跨布局不变量。

第三步:同时测三个层次。 人类给出认知上限;ImageNet 预训练的 ViT、Swin、ConvNeXt,以及 SigLIP、DINOv2 在任务数据上 fine-tune,测“有大量监督后能否跨布局”;闭源 MLLM 直接看图回答,测通用模型的零样本能力。

第四步:从分数进入错误结构。 GPT-o1 在 shortest path 总体 55%,但表 3 显示 path length=1 只答对 28%,length=2 却为 69%。作者据此提出 Easier-Worse Anomaly:如果模型真正理解“相邻即距离 1”,最简单类别不应比更长路径差 41 pp。Hamiltonian cycle 的 66% 也主要来自检测 leaf node 这一捷径;移除 leaf-node cases 后接近随机。

论文的关键权衡是:为了隔离纯视觉概念化,它明确要求 MLLM “without using code”。这让 benchmark 更像人类视觉直觉测试,却也意味着它没有评估现代 agent 最实用的能力——先把图转写为 adjacency list,再调用确定性算法。因此 VGA 诊断的是单次视觉到结构的闭环能力,不是工具增强系统的最佳可达性能。

1.3 方程级形式化:VGA 真正测的是什么

设抽象图为 (G=(V,E)),布局算法为 (ellL),渲染器为 (R),得到图像:

[ x_{G,}=R(G;). ]

任务标签只由图结构决定:

[ y=(G), ]

其中 ( au) 可以是同构真假、是否存在 Hamiltonian path/cycle、两标记节点的最短路长度,或最大无弦环长度。理想视觉推理器 (f_) 应满足布局不变性:

[ f_(R(G;1))=f(R(G;_2))=(G), _1,_2L. ]

若训练布局集合为 (mathcal L_{tr})、测试布局为未见过的 (mathcal L_{te}),可定义真正想测的 layout generalization gap:

[ {layout}=(L{tr})- (L_{te}). ]

但核心论文除 shortest-path 的多布局测试外,没有系统报告同一模型、同一 underlying graph distribution 下的 in-layout 与 cross-layout 成对结果,因此多数任务的 (Delta_{layout}) 不可计算。论文实际报告的是 cross-layout accuracy,而不是完整的不变性曲线。

六项标签可形式化为:

  • 同构:(y=[: A_2=P_A_1P_^]);hard negative 与 positive 具有相同 degree sequence,排除简单度数捷径。
  • Hamiltonian path:(y=[(v_1,,v_{|V|}), (v_i,v_{i+1})E])。
  • 最短路:(y=d_G(s,t){1,2,3,4})。
  • Hamiltonian cycle:在 Hamiltonian path 条件上再要求 ((v_{|V|},v_1)E)。
  • 最大无弦环:(y=_{CG}|C|{3,4,5,6}),且 cycle 中非相邻节点间无 chord。

从机制上,成功路径应当是:

像素图像
  ↓ 节点检测 + 边追踪
显式或隐式邻接结构 Â
  ↓ 置换/布局不变的关系运算
图论性质 τ(Â)
  ↓
答案

VGA 只观察最终答案,并在附录 D 用 3 张图做 adjacency-matrix 转写案例;它没有对所有 benchmark 样本提供节点/边解析准确率。因此,最终错误仍可能来自“边没看清”或“图看清但不会推理”任一环节。

1.4 数据集与工程实现

机制 / 维度 设计选择 动机 论文报告的关键配置
图规模 connected graphs,8–9 节点 人类可检查,又可生成大规模样本 原始集合:11,117 个 8-node;261,080 个 9-node,附录 B
渲染 700×700 原始 canvas;random / Kamada–Kawai / planar 改变形式而保持结构标签 附录 B
任务 同构、路径、环,各两项 从二分类到四分类、从局部到全局结构 主文 §3
类别平衡 二分类正负平衡;四分类各长度平衡 降低 label prior 捷径 主文 §3、附录 B
视觉模型 ViT-B、Swin-T-B、ConvNeXt-B、SigLIP-B、DINOv2-B 比较卷积、监督 Transformer、视觉语言与自监督预训练 主文 §4
Fine-tuning Adam,LR (10^{-4}),batch 32,10 epochs,CrossEntropy 任务监督适配 附录 C,第 12 页
输入尺寸 384×384 与预训练输入设置对齐 附录 C
硬件 2× NVIDIA TITAN RTX 训练视觉模型 附录 C
模型选择 每 epoch 在 test set 评估,选择 test 表现最好的 epoch 论文原实现 附录 C;这是测试泄漏风险
MLLM 每任务随机 100 个样本;禁止代码 测直接视觉推理 主文 §4、附录 E
人类 15 名工程学院学生/员工;24 题,每任务 4 题 建立人类参照 主文第 6 页

六任务规模矩阵

概念 任务 训练样本 测试样本 类别 训练 → 测试布局 来源
Isomorphism Easy 140,000 15,718 2 paired Kawai/planar;graph split 表 1、附录 B.1
Isomorphism Hard degree-equivalent 127,374 14,298 2 paired Kawai/planar;hard negative 同 degree sequence 表 1、附录 B.1
Path Hamiltonian path 25,000 2,480 2 Kawai → planar 表 1、§3.2
Path Shortest path 80,000 8,672 4 表 2 脚注/目录图:random → random/Kawai/planar;附录 B.2 文字却写 Kawai → planar 表 1、表 2 脚注、附录 B.2
Cycle Hamiltonian cycle 69,935 7,740 2 Kawai → planar 表 1、§3.3
Cycle Biggest chordless cycle 80,000 6,484 4 Kawai → planar 表 1、§3.3

表 1 的训练总量为 522,309,按每个任务单列测试集相加为 55,392。但 shortest path 实际有三种测试布局,附录目录图还为 Hamiltonian path/cycle 和 chordless cycle列出 Kawai 与 planar 两份测试目录;表 1 的 “#Testing Samples” 是每布局还是合并计数并不完全清楚。因此不能据表 1 直接断言所有图像文件总数。

1.5 主结果:完整可核验矩阵

下表逐项转录核心论文表 2;FAIL 是作者借用 Long Range Arena 的用词,表示接近随机,但论文没有给出精确数值或统一阈值。二分类 chance 为 50%,四分类 chance 为 25%。短横线表示该模型/布局未报告。

方法 Iso-Easy Iso-Hard Ham. Path Shortest-Random Shortest-Kawai Shortest-Planar Ham. Cycle Chordless 来源
Human 95.0 91.6 96.6 98.3 100.0 100.0 93.3 88.2 表 2,第 1 行
ViT Base FAIL FAIL 57.0 67.4 66.7 64.4 67.8 32.3 表 2,第 2 行
Swin-T Base FAIL FAIL 65.8 68.6 65.7 65.4 71.1 34.4 表 2,第 3 行
ConvNeXt Base FAIL FAIL 72.9 73.3 82.4 73.3 74.9 36.3 表 2,第 4 行
SigLIP Base 54.4 FAIL 59.5 25.2 63.5 28.0 表 2,第 5 行
DINOv2 Base FAIL FAIL 56.8 36.4 FAIL 31.1 表 2,第 6 行
GPT-o1 FAIL FAIL FAIL 55.0 66.0 FAIL 表 2,第 7 行
GPT-4o FAIL FAIL FAIL FAIL FAIL FAIL 表 2,第 8 行
Claude 3.5 Sonnet FAIL FAIL FAIL FAIL FAIL FAIL 表 2,第 9 行

按六个有精确值的非同构列复算,ViT、Swin、ConvNeXt 平均分别为 59.27%、61.83%、68.85%;ConvNeXt 对 Swin 平均高 7.02 pp,对 ViT 高 9.58 pp。这支持“卷积 backbone 在这组细线条关系图上更强”的描述性结论,但论文没有多随机种子、误差条或显著性检验,不能把差异稳健归因于架构类型。

人类与逐列最强视觉模型的可计算差距为:easy isomorphism 40.6 pp、Hamiltonian path 23.7 pp、shortest-random 25.0 pp、shortest-Kawai 17.6 pp、shortest-planar 26.7 pp、Hamiltonian cycle 18.4 pp、chordless cycle 51.9 pp。最大无弦环的 51.9 pp 是全文最有说服力的单项差距:四分类随机为 25%,ConvNeXt 36.3% 只高 11.3 pp,而人类为 88.2%。

GPT-o1 的错误矩阵

Ground truth  Prediction 1 2 3 4 该类准确率 来源
Length 1 28.0 67.0 5.0 0.0 28.0 表 3,第 1 行
Length 2 18.0 69.0 13.0 0.0 69.0 表 3,第 2 行
Length 3 0.0 40.0 60.0 0.0 60.0 表 3,第 3 行
Length 4 0.0 5.0 40.0 55.0 55.0 表 3,第 4 行

最明显的 failure mode 不是远距离路径,而是相邻节点:67% 的 length-1 样本被预测为 2。作者据此提出 Easier-Worse Anomaly。但还应注意,表 3 写 28%/69%,§5.3 又写 29%/70%;表 2 对 Hamiltonian cycle 写 66.0%,表注写 66.6%,正文写 67%。这些看似只是四舍五入,却暴露了结果口径没有完全统一。

1.6 消融、超参敏感性与统计显著性

消融研究

论文没有报告标准的模型消融。没有逐步比较:

应有消融 论文是否报告 因而不能回答的问题
同一 underlying graph,train/test 只换 layout 部分任务按设计实现,但未给配对 per-graph 结果 错误究竟由布局变化贡献多少
同布局 in-domain vs 异布局 OOD 除 shortest path 外未系统报告 无法计算 (Delta_{layout})
图像 → adjacency oracle → solver 未报告 无法分解视觉解析错误与图论推理错误
位置/边交叉/线宽/节点大小单因素扫描 未报告 不知道哪种视觉因素导致崩溃
数据规模曲线 未报告 27k–140k 是否已饱和、更多数据是否有效
去 ImageNet pretraining / 冻结 backbone 未报告 预训练的作用与负迁移无法区分
多 seed 与不同 epoch selection 未报告 ConvNeXt 优势是否稳定

附录 D 的 adjacency-matrix transcription 只用 3 张图,属于定性案例,不足以作为 perception ablation。它仍提供重要线索:所有闭源 MLLM 都难以正确转写,Claude 3.5 Sonnet最接近节点与边数,说明最终图论错误至少有一部分发生在视觉结构提取阶段。

超参敏感性

论文仅给出单组训练配置:LR (10^{-4})、batch 32、10 epochs、384×384、Adam、2×TITAN RTX;未报告学习率、分辨率、augmentation、epoch、weight decay 或不同节点规模的敏感性曲线。因此不能判断 8–9 节点是否是性能相变点,也不能判断分辨率从 384 提升到 768 是否会显著改善细边读取。

可以观察到一个值得后续验证的“任务相变”:四分类 chordless cycle 上所有精确结果仅 28.0%–36.3%,接近 25% chance;而二分类 Hamiltonian cycle 的视觉模型达到 63.5%–74.9%。这可能来自 global cycle enumeration 难度,也可能来自二分类中的 leaf-node shortcut。没有按 leaf count、edge density、crossing count 分层,不能确定相变来源。

统计显著性

视觉模型只报告一个 best test accuracy,没有标准差;MLLM 每任务 100 样本但没有置信区间;人类只有 15 人且每任务 4 题。论文不报告 p 值、置信区间、bootstrap、paired test 或 effect size。更严重的是,附录 C 明确写“每个 epoch 在 test set 上评估,并选择 test set 上表现最好的模型”,所以表 2 的视觉模型数字不是一次封闭测试,而带有 10 次 epoch-level selection 的乐观偏差。

1.7 真正贡献、复用价值与迁移潜力

VGA 真正的贡献不是又增加六道图论题,而是提供一种 benchmark 设计原则:对概念保持不变,对表示形式实施可控干预。在视觉研究里,常见 OOD 测试把背景、风格、类别频率和数据来源同时改变,难以解释失败。VGA 试图只改 layout,让“概念不变性”成为可检验对象。

可脱离本文复用的设计包括:

  1. paired renderer intervention:对同一结构生成多种布局,构造反事实图像对;可迁移到分子、逻辑电路、流程图、交通网络与 UI wireframe。
  2. hard negative by invariant matching:同构 hard negative 保持 degree sequence 相同,迫使模型超越节点数、边数和度数统计。
  3. 错误单调性审计:不仅看总 accuracy,还检查更简单实例是否反而更差;这一思想可用于数学、空间关系、计数与工具调用 benchmark。
  4. 人—模型最小能力差:选人类无需专门训练即可解决的小规模任务,避免把“专家知识差”误当成“感知差”。

迁移潜力也很明确:如果把 underlying structure 改成电路 netlist、化学分子图或流程依赖图,就可以测模型是否从多种绘图规范恢复同一关系。但下一代 benchmark 应同时给 pixel-only、oracle adjacency、tool-enabled 三条轨道,分别测 perception、reasoning 与 agent orchestration。

1.8 局限性

论文自述或明确承认的限制

  1. 任务域有限。 论文结论与 Future Work(第 8 页)明确指出当前只覆盖小型图,下一步应扩展到化学结构和逻辑电路;因此“概念化”尚未跨领域验证。
  2. 模型对 graph transcription 本身就困难。 附录 D(第 17 页)承认 GPT-4o/o1、Claude 3/3.5 都无法稳定生成正确 adjacency matrix,说明视觉解析是首要瓶颈。
  3. 现有概率训练可能导致模仿式捷径是作者假说,不是已证实机制。 §5 把 pseudo-intelligence 与训练范式联系起来,并提出 RL 可能是路径;论文没有相应训练实验验证这一机制解释。

补充批判(独立观察,10 点)

  1. 实验设计问题|测试集泄漏。 因为附录 C 明确在每个 epoch 上评估 test set,并选择 test accuracy 最好的 epoch,所以每个视觉模型实际上对 test set 做了 10 次隐式模型选择;因此表 2 不是严格 held-out estimate,差异可能被乐观放大。
  2. 论证缺口|视觉解析与图论推理未解耦。 因为附录 D 已显示 adjacency transcription 失败,而正文没有在 oracle adjacency 输入下测试同一模型,所以“缺乏 conceptualization”也可能是线条/节点读取错误;最终准确率不能单独定位推理层缺陷。
  3. 实验设计问题|layout shift 与 graph-distribution shift 混杂。 因为附录 B.2 的 shortest-path 先把 planar graphs 分到 test、剩余 non-planar graphs 用于 train,再改变绘图 layout,所以 train/test 不只换画法,underlying graph family 也可能变化;不能把全部 gap 归因于视觉表示形式。
  4. 指标有效性问题|FAIL 隐藏效应大小。 因为表 2 用 FAIL 代替十多个精确数值,且二分类和四分类的 chance 分别是 50% 与 25%,所以读者无法判断是 49.9%、25.1%,还是明显低于随机;也无法计算模型均值、置信区间或公平排名。
  5. 统计设计问题|人类基线过小且协议不清。 因为只有 15 人、每任务 4 题,单任务最多 60 次 judgment;但 shortest path 又分别报告 random/Kawai/planar 三列,论文没有说明 24 题如何覆盖这些布局、是否重复图或是否每人看到全部变体,所以人类—模型比较缺少可审计 denominator。
  6. 可复现性风险|闭源模型版本与采样设置缺失。 因为 GPT-4o、o1、Claude 3.5、Gemini 会持续更新,而论文没有精确 snapshot、API 日期、temperature、max tokens、重试和拒答处理,所以 100-sample 结果无法稳定复现。
  7. 论证过度|“pseudo-intelligence”不是唯一解释。 因为 GPT-o1 对 length 1 为 28%、length 2 为 69%(表 3),所以确实存在非单调错误;但这也可能由方形标记遮挡边、边接触视觉歧义或 prompt parsing 引起。未做视觉可见性控制前,不能排除感知 artifact。
  8. 缺乏关键对比|没有工具增强轨道。 因为 VisionGraph 已展示“图描述 → adjacency → 代码/解释器”的 DPR 路线,而 VGA 明令禁止代码,所以论文只证明直接视觉回答困难,不能推出实际 agent 系统也无法解决;应在同 100 样本上比较 pixel-only、oracle graph、OCR/edge detector、Python solver。
  9. 失手子任务|大规模监督仍接近 chance。 因为 chordless cycle 有 80,000 个训练样本,但 ConvNeXt 仅 36.3%,比四分类 chance 高 11.3 pp;所以“增加监督数据即可学会不变量”缺乏支持。需要数据规模曲线判断问题是样本不足还是表示/优化不匹配。
  10. 报告一致性问题|数字与配置口径漂移。 因为 GPT-o1 shortest-path 表 3 为 28/69,§5.3 写 29/70;Hamiltonian cycle 表 2 为 66.0,表注为 66.6,正文为 67;此外表 2 脚注与附录目录图写 shortest-path 训练布局为 random,附录 B.2 文字却写 Kamada–Kawai,所以即使前者只是四舍五入,后者也已影响复现配置,必须由代码和原始 count 消歧。

2. 相关工作回溯:从“去偏 VQA”到“布局反事实”

2.1 CLEVR — 2017,CVPR

解决了什么。 CLEVR 用程序化场景、函数式问题模板和可追踪的 reasoning program,把对象识别、计数、比较、空间关系与组合推理变成可诊断任务。论文报告 100,000 张渲染图、约 100 万个自动生成问题,其中 853,000 个问题唯一。它首次大规模说明:合成数据不是为了逼真,而是为了控制偏差与推理链。

遗留了什么。 CLEVR 的物体外观、渲染风格和关系语法相对固定;即便 CoGenT 做颜色—形状组合泛化,它主要改变属性组合,并没有系统地把同一关系结构以完全不同的视觉几何呈现。

VGA 如何回应。 VGA 沿用“程序生成 + 确定标签 + 合成控制”框架,但把干预单位从物体属性换成 graph layout。标签 ( au(G)) 固定,节点坐标与边几何变化,测试模型是否学习关系而非画法。

关键设计传递。 CLEVR 的功能程序与分解式诊断思想,传递为 VGA 的六个原子图论任务;不同之处在于 VGA 没有提供每个样本的可执行 reasoning trace,这也削弱了错误归因能力。

2.2 FigureQA — 2017/2018,预印本

解决了什么。 FigureQA 将合成柱状图、折线图和饼图与关系型问答结合,构造超过 100,000 张图和超过 100 万个问答对;问题覆盖大于/小于、最大/最小、趋势、交点等。它把视觉推理从自然图像推进到科学图表。

遗留了什么。 FigureQA 主要问图中数据之间的可见关系;同一数据能否在不同 chart theme、layout 或绘图库下保持推理稳定并不是核心评测轴。模型仍可能学习图表模板、颜色与位置统计。

VGA 如何回应。 VGA 选择没有文字与数值轴的抽象图,避免 OCR 与数值读取主导;同时明确用 Kawai/random/planar 改变 geometry,迫使模型面对结构—表现分离。

关键设计传递。 FigureQA 的“可程序生成科学视觉 + 自动验证答案”被保留;VGA 进一步把布局设置成 OOD 变量,但牺牲了 FigureQA 对多类图表和自然语言问法的覆盖。

2.3 Visual Concept-Metaconcept Learning — 2019,NeurIPS

解决了什么。 VCML 不只学习 red、cube 等 visual concept,还学习 synonym、same-kind、hypernym 等 metaconcept,并以神经符号程序执行问题。它把“概念之间的关系”显式编码为可学习 operator,在 CLEVR、GQA、CUB 上测试新概念与元概念泛化。

遗留了什么。 VCML 假设视觉对象 proposal、语义解析与 DSL 均可用,推理发生在结构化的 concept embedding 空间;它没有回答端到端像素模型是否能在没有显式 scene graph 的情况下恢复结构不变量。

VGA 如何回应。 VGA 把中间结构全部隐藏,只给像素和简短问题,观察通用视觉模型是否自发形成等价的关系表示。结果显示,即使 8–9 节点图,人类与模型仍有 18.4–51.9 pp 的可计算差距。

关键设计传递。 “概念不是类别标签,而是可跨实例/表征操作的关系结构”这一思想直接传入 VGA;但 VGA 只有终值 accuracy,没有 VCML 那种显式 operator 与 program trace,因此诊断粒度更粗。

2.4 VisionGraph — 2024,arXiv

解决了什么。 VisionGraph 直接以图像形式提出 8 类图论题,共 5,902 个 problems;每张图配 3 个问题,合计 17,706 个问答。它测节点/边识别与 connectivity、cycle、topological sort、shortest path、max flow、matching、Hamilton path、GNN update,并提出 Description–Program–Reasoning(DPR):先生成图描述/邻接,再选择算法和代码,必要时调用 Python。

遗留了什么。 VisionGraph 的主要维度是问题类型和节点数难度,布局不变性不是中心变量;其图像在节点增多后可能出现视觉拥挤。它还把 perception、program generation 与 tool execution串成整体,难以单独回答“模型是否以人类直觉方式概念化”。

VGA 如何回应。 VGA 将节点限制为 8–9 个、保证视觉可检查,并用不同布局作为 train/test 干预;同时禁止代码,故意把问题收缩为端到端视觉抽象。

关键设计传递。 VisionGraph 的 graph-image benchmark 形式被继承;VGA 增加大规模监督集(单任务训练 25,000–140,000)和 human baseline。但 VisionGraph 的 DPR 也揭示 VGA 的缺口:实际系统可通过显式 adjacency 与工具补偿端到端直觉不足。

人类与 ConvNeXt:跨布局任务仍存在 17.6–51.9 pp 差距

仅绘制表 2 中双方都有精确数字的六列;同构任务因 ConvNeXt 只标为 FAIL 而不做像素估值。

Human ConvNeXt Base
VGA 六项任务上人类与 ConvNeXt Base 准确率 人类在 Hamiltonian path、shortest path random、Kawai、planar、Hamiltonian cycle、chordless cycle 上分别为 96.6、98.3、100、100、93.3、88.2;ConvNeXt 分别为 72.9、73.3、82.4、73.3、74.9、36.3。 020406080100% Ham. Path SP Random SP Kawai SP Planar Ham. Cycle Chordless
单位:accuracy(%)。来源:核心论文表 2;条形长度按单一 0–100% 横轴绘制,精确数字及来源行见正文矩阵。

3. 技术演进脉络

2017 CLEVR [合成场景;程序化问题;去语言/标签偏差]
   ├── 2017/18 FigureQA [科学图表;自动问答;关系比较]
   └── 2019 VCML [概念 + 元概念;显式 operator;神经符号程序]
                  │
                  ├── 路线 A:显式结构后再推理
                  │      2024 VisionGraph [节点/边识别 → DPR → 代码/工具]
                  │
                  └── 路线 B:端到端结构不变量诊断
                         2025 VGA [同一图结构 × 多布局;禁止代码]
                                  ├─ 发现:同构接近随机
                                  ├─ 发现:length-1 反而比 length-2 差 41 pp
                                  └─ 缺口:未拆开 perception 与 reasoning

演进背后的推动力经历了三次转移:早期关注“答案是不是靠语言偏差猜出来”;随后关注“模型是否能组合概念和关系”;现在开始关注“同一关系换一种视觉实现后是否仍成立”。VGA 的转折是把 layout 从 nuisance 变成实验变量。不过下一阶段很可能重新汇合两条路线:既要有 pixel-only 轨道测直觉式概念化,也要有 structured/tool轨道测实际任务完成能力,并报告两者之间的结构恢复损失。

3.1 跨论文对标

工作 发表年月 会议/出版 核心贡献 规模 / 主要指标 与 VGA 的关系
CLEVR 2017.07 CVPR 程序化合成视觉推理诊断 100k images;约 1M questions 提供可控生成与原子推理范式
FigureQA 2018.02(v2) arXiv 科学图表关系问答 >100k images;>1M QA 将合成推理推向图表视觉
VCML 2019.12 NeurIPS 联合学习 visual concepts 与 metaconcepts CLEVR/GQA/CUB 概念作为可操作关系,而非类别
VisionGraph 2024.05 arXiv 8 类视觉图论题与 DPR agent 5,902 problems;17,706 QA 最直接前驱;偏工具增强、非布局不变性
VGA 2025.07 ICML 六任务、大规模跨布局图像 benchmark 522,309 train;表 2 人类 88.2–100% 把 layout 变成受控反事实变量

4. 开放挑战与可操作研究机会

4.1 理论与评测层面

  1. 把概念化拆成可识别的误差项。 对每张图同时评估 node F1、edge F1、graph edit distance、最终 property accuracy;在 oracle adjacency 下再运行同一 reasoning module。比较 pixel→answerpixel→adjacency→answeroracle adjacency→answer,量化 perception 与 reasoning 各占多少错误。
  2. 严格估计 layout generalization gap。 固定同一批 underlying graphs,为每个图生成 random/Kawai/planar 三视图;用 graph-stratified split,禁止同一图跨 split。报告 3×3 train-layout→test-layout 矩阵,而不是只给单向 Kawai→planar。
  3. 建立不变性—准确率联合指标。 除 accuracy 外,报告同一图三视图预测一致率: [ C(G)=_{_i_j} [f(R(G;_i))=f(R(G;_j))]. ] 高一致但全错与低一致需区分。

4.2 工程与应用层面

  1. 修复 test leakage 的正式复现。 按 graph identity 划分 train/validation/test;validation 选 epoch,test 只运行一次;5 seeds 报 mean±std 与 paired bootstrap。与论文“每 epoch 看 test”数字并列,测乐观偏差有多大。
  2. 多分辨率与视觉退化扫描。 在 224/384/768/1024 分辨率、1–5 px 线宽、不同 antialias、节点半径与 crossing count 下对比 ConvNeXt、ViT、现代 VLM。目标不是追最高分,而是找到结构读取发生突变的视觉阈值。
  3. 等预算架构对比。 统一参数量、预训练数据、输入分辨率与训练步数,比 ConvNeXt、ViT、Swin、graph-aware vision encoder;否则表 2 的 9.58 pp 平均差不能归因于卷积 inductive bias。
  4. 工具增强 head-to-head。 在同一 100 样本、同一 API snapshot 下比较 direct answer、CoT、先转 adjacency、调用 NetworkX 四种策略;同时报告正确率、token、延迟与 adjacency edit distance。

4.3 新兴方向

  1. 从静态图扩到视频中的关系恒常性。 让节点连续移动但边关系不变,比较单帧 VLM、video encoder 与显式 tracker;测试模型能否区分 layout motion 与 topology change。
  2. 跨领域同构迁移。 用同一 underlying graph 分别渲染为电路、分子、流程图与社交网络,训练于其中三域、测试第四域;这比同域三布局更接近真正的概念迁移。
  3. 生成—验证闭环。 让 VLM先生成 adjacency,再用 differentiable renderer 重画,与输入做结构对齐;比较 reconstruction supervision、contrastive invariance 与纯分类损失,控制总数据和算力。
  4. 安全与可靠性。 对关键工程图加入一条细边、遮挡或伪交叉,测 graph edit robustness;要求系统在 adjacency uncertainty 高时拒答,而不是给出流畅但错误的图论解释。

5. 其他值得关注的近期工作

Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas(2025.07,ICML)
从 attention focus 分析 VLM 空间推理失败,可与 VGA 的边/节点感知瓶颈形成机制互证。
PMLR

Vision Graph Prompting via Semantic Low-Rank Decomposition(2025.07,ICML)
把视觉关系显式图化并以低秩语义结构做 prompting,代表“给模型结构先验”而非只扩大端到端数据的路线。
PMLR

From Local Details to Global Context: Advancing VLMs with Attention-Based Selection(2025.07,ICML)
研究局部视觉细节的选择与全局上下文整合;VGA 的细边读取和全图 cycle 推理正好覆盖这两个尺度。
PMLR

A Closer Look at Multimodal Representation Collapse(2025.07,ICML)
诊断多模态对齐中的表示坍缩,值得用于追问“layout 不变”是否被错误实现为丢失结构信息。
PMLR

Contrastive Localized Language-Image Pre-Training(2025.07,ICML)
将图文对齐从全局推进到局部定位;对 VGA 而言,局部 node/edge grounding 是形成邻接结构的前提。
PMLR

Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation(2025.07,ICML)
处理超长视频中的层次化视觉压缩,提示 VGA 未来扩展到动态图时必须同时控制关系保持与 token 压缩损失。
PMLR

LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models(2025.07,ICML)
从系统侧扩展长视觉输入,适合与大规模电路图/流程图 benchmark结合,但“看得更多”仍不等于“恢复正确结构”。
PMLR

6. 最终判断

VGA 是一篇有价值的诊断型论文。它最重要的证据不是“某模型又低了几个点”,而是三组互相补强的现象:同构任务接近随机;最大无弦环上 ConvNeXt 与人类相差 51.9 pp;GPT-o1 对 length-1 的最简单最短路仅 28%,却对 length-2 达 69%。这些结果足以否定“当前视觉模型已经稳定掌握小图结构”的乐观叙事。

但论文把失败进一步解释为 conceptualization/pseudo-intelligence 时跨得太快。测试集选 epoch造成泄漏,FAIL 隐藏精确数值,human protocol 与闭源模型设置不完整,最关键的是没有 oracle adjacency 控制来区分“边没看清”与“看清后不会推理”。因此更稳健的结论应是:当前模型没有从像素到图论答案形成布局稳健的端到端映射;至于瓶颈位于感知、结构恢复、算法推理还是它们的接口,VGA 还没有完成因果分解。


索引状态:已更新 ml-report-index.md
坦诚说明:论文未公开完整训练仓库,未给 FAIL 对应的精确准确率、视觉模型多 seed 结果、超参敏感性或严格 held-out test;本报告没有补造这些数字。HTML 采用 Warm Editorial Report 单文件模板并通过结构验证;当前执行环境未发现 /usr/bin/chromium/opt/pw-browsers 下的可执行 Chromium,因此无法诚实声称完成 Playwright 截图 QA,已以响应式静态规则、标题/表格/SVG 语义检查与零警告 validator 作为降级验证。