ML/AI 每日深度追踪 · 周日 · AI4Science 与跨界

层类型不是常量,是超参——而且它值 30% 的性能

MolGraphBench: A Benchmark of GNN Architectures for Molecular Regression Tasks

arXiv:2602.20573v3 2026-06-18 · cs.LG 图学习 × 计算化学 5 数据集 · 12 方法 · 4 判据 ⚠ 代码仓库未能定位

分子图学习领域用了五年时间,把「底层卷积层类型」当成一个不需要讨论的背景常量。本文的数据说明这个常量在迁移学习场景下值 30.0% 的性能——比一篇 Nature 子刊论文的全部创新高出约四倍。但本文自身在 5 个数据集中的 4 个上,其宣称的「最优架构」不具统计显著性。

  1. 报告方法学声明(坦诚性前置)
  2. 链接验证清单
  3. 核心论文深度解析
  4. 相关工作回溯(问题传递链)
  5. 技术演进脉络
  6. 相关工作表格对标
  7. 开放挑战与研究机会
  8. 其他值得关注的近期工作
  9. 结论:这篇论文该怎么读

0 · 报告方法学声明

在进入正文前,先把本期报告的三个已知局限摆在明面上:

  1. 去重索引不可达。本次运行是云端定时任务,用户本地设备桥在定时运行中从不连接。因此 ml-report-index.md 无法读取,14 天去重检查未能执行,索引也未能自动追加本期记录。
  2. 随机抽取过程。候选池 27 篇(AI4Science 方向,2025-08 至 2026-08),shuf -i 1-27 -n 1 抽中索引 6 = MolGraphBench。重抽次数:0。资料充分性检查通过。
  3. 分析基于 arXiv HTML v3 全文,不含补充材料。论文正文指向的代码仓库经多轮检索未能定位,因此超参搜索空间、逐数据集 CKA 数值、训练时间秒数三项无法核实,凡涉及处均已标注。
本报告的增量在于派生统计量。所有相对提升百分比、跨数据集平均排名、双样本 t 统计量、指纹融合增益矩阵,均由本人从论文 Table 2/3/4 的原始数值重新计算得出——论文自身未报告这些量,而正是它们改变了对本文结论的判断。

1 · 链接验证清单

所有链接均经实际访问验证。「未找到」= 多轮检索后仍无法定位;「403」= 页面确实存在但抓取被反爬拦截,标题与卷期经镜像交叉确认。

1.1 核心论文

论文会议 / 期刊页arXivCode数据集
MolGraphBench 无(arXiv 预印本,未见会议收录) 2602.20573v3
cs.LG · 2026-06-18
⚠ 未找到
正文声明 rajanbit/MolGraphBench
MoleculeNet · B3DB · GNN-TL(RT)
版本异常提示。v1/v2 标题为 "Benchmarking GNN Models on Molecular Regression Tasks with CKA-Based Representation Analysis",v3 才改为 "MolGraphBench: ...";搜索引擎索引仍停留在旧标题。同时 v2 正文声明数据代码「可向作者合理索取」(无仓库),v3 才新增 GitHub 链接——而该链接检索不到。两者结合,建议对本文可复现性保持保留态度。

1.2 相关工作

论文会议 / 期刊页arXivCode
MPNN · Gilmer et al., ICML 2017PMLR v701704.01212未找到
MoleculeNet · Wu et al., Chem. Sci. 2018RSC DOI · 开放全文1703.00564deepchem · moleculenet
FP-GNN · Cai et al., Brief. Bioinform. 2022OUP DOI2205.03834idrugLab/FP-GNN(二手引用)
GNN-TL · Yang et al., J. Chromatogr. A 2021ScienceDirect(403,镜像确认)未找到(无预印本)Qiong-Yang/GNN-TL
Position: Poor Benchmarks · Bechler-Speicher et al.ICML 2025 Position Track2502.14546不适用
MolGraph-xLSTM · Sun et al., Commun. Chem. 2025Nature DOI2501.18439syan1992/MolGraph-xLSTM(二手引用)
CKA 分子嵌入 · Welsch et al., JCIM 2024ACS DOI无(ChemRxiv未找到
GCN · Kipf & Welling, ICLR 20171609.02907
GraphSAGE · Hamilton et al., NeurIPS 20171706.02216
GAT · Veličković et al., ICLR 20181710.10903
GIN · Xu et al., ICLR 20191810.00826powerful-gnns

注:在抓取到的 v3 参考文献列表中,未出现 Xu et al. (2019) 的 GIN 原始论文条目,而 Kipf&Welling、Hamilton、Veličković 三篇均在列。这可能是 HTML 抽取不完整所致,也可能是真实的引用遗漏。无法确认是哪一种,故仅作提示,不计入批评条目。

2 · 核心论文深度解析

2.1 一句话定位

GNN 的层类型不是架构设计时一次性钉死的结构常量,而是应当与学习率、隐藏维度并列、逐数据集调优的超参数——而且这件事在迁移学习场景下的重要性,比从头训练时高出四到五倍。

后半句是本报告的派生结论。论文自己只说到前半句,并未意识到该效应是分场景的。这个「分场景」正是本文最有价值却被作者自己错过的发现(见 §2.5.4 相变分析)。

2.2 Motivation 与问题论证

论文指向的痛点

论文的问题陈述在字面上很朴素:「尽管 GNN 在分子性质预测上应用激增,一个严谨的基准仍然缺失。」但这句话背后有一个更具体、可验证的观察。论文 Table 1 梳理了近年提出的「新」GNN 架构,并按其底层层类型分类:

底层层类型建立于其上的近期工作
GCNGNN-TL、MvMRL、MolGraph-xLSTM、GraphB3
GATFP-GNN、AttentiveFP、TChemGNN
GAT + 其他KA-GNNs(GAT+GCN 或 GAT+GIN)、DGCL(双图,GAT+GIN)
MPNN 变体D-MPNN、FH-GNN、GMC-MPNN
Graph TransformerCLAPS

这张表暴露的问题是:这些工作各自选定一种底层层类型,然后在其上堆叠创新(xLSTM、MoE、对比学习、KAN、指纹融合),并把最终性能提升全部归因于自己的创新模块。但没有任何一篇做过「如果只换底层层类型会怎样」的对照实验。整个子领域的增量声明,都建立在一个未经检验的假设上:底层层类型的影响很小,可视为背景常量。

痛点的量化(论文未做,本报告补算)

在完全相同的迁移学习流水线下(相同预训练语料 METLIN、相同微调协议、相同数据集 RT、相同 MLP 头),只改变卷积层类型

层类型完全微调 MAE相对最差者
GCN75.621 ± 3.456
GAT72.195 ± 1.112−4.5%
GraphSAGE70.752 ± 2.750−6.4%
GIN52.914 ± 1.218−30.0%
30.0% 的相对差距,完全由「换一个卷积层」产生。作为对照,MolGraph-xLSTM(Commun. Chem. 2025)作为一整篇论文的贡献,在 ESOL 上相对其 baseline HiGNN 的提升是 7.54%。一个免费的层类型替换,其效应量约为一篇 Nature 子刊论文全部创新的四倍。这是论文 Motivation 最有力的证据,而论文自己没有把它算出来。

为什么值得解决

2.3 论文的故事线(论证结构)

论文的论证不是线性的「提方法—做实验—报结果」,而是一个四判据收敛结构:

  1. 把「最优架构」拆成四个判据——绝对性能、训练效率、迁移学习、预测质量。设计权衡是:牺牲结论锐利度,换取结论稳健性。若四条判据指向同一架构则结论强;若分歧,则说明「最优架构」本身是伪命题。
  2. 先证明 GNN 值得讨论——用 GNN vs 传统 ML 的对比确立地基。若 ECFP4+SVM 全面胜出,后面三步都没意义。
  3. 引入两个正交探针解释差异来源——CKA 探针(借自 Welsch et al. 2024)测量表示互补性;高误差分子探针测量误差分布而非幅度。这是全文最聪明的设计。
  4. 用迁移学习作终审——四判据中唯一涉及「表示可复用性」的,也最贴近实际部署。
关键转折点与论证断裂。论文在 §3.2 观察到 CKA(GNN, FP) 仅 0.27–0.59(低相似 = 高互补),据此预期融合应当有效;实验却显示融合基本无效。论文用「counterintuitive(反直觉)」一词标记这个矛盾——然后止步于此,没有解释它。这是全文最大的论证断裂(详见 §2.7 第 ④ 条)。

2.4 方法论与机制解剖

设分子 SMILES 经 RDKit 解析得图 G=(V,E),节点为原子、边为化学键,节点特征 X ∈ R^{N×118}(元素周期表 one-hot)。完整流水线:

SMILES │ ├─► RDKit 解析 ─► 分子图 G=(V,E), X ∈ R^{N×118} │ │ │ ▼ │ [FC 投影层] X_h = W_p · X ∈ R^{N×H} │ │ │ ▼ │ [2–3 层图卷积] 每层内部: │ │ m_v^(l) = AGG({h_u^(l-1) : u ∈ N(v)}) ◄── 层类型差异所在 │ │ h_v^(l) = UPD(h_v^(l-1), m_v^(l)) ◄── 层类型差异所在 │ │ h_v^(l) = ReLU(GraphNorm(h_v^(l))) + h_v^(l-1) │ ▼ │ [全局池化] G_embed = MEAN_v(h_v^(L)) ⚠ GIN 用 ADD 池化(混淆点) │ │ └─► ECFP4 (1024-bit) ─► [FC 投影层] ─► F_embed (仅 GNN-FP 变体) │ ▼ concat(G_embed, F_embed) 或 G_embed │ ▼ [2 层 MLP 回归头] ─► ŷ ∈ R

四种层类型的差异仅在 AGG / UPD

AGGUPD关键性质
GCN度归一化均值 Σ h_u/√(d_v d_u)线性 + 非线性各向同性、谱域动机
GAT注意力加权和 Σ α_vu·h_u线性 + 非线性邻居自适应加权
GraphSAGE均值后与自身拼接W · [h_v ‖ AGG]自身与邻居分离编码
GIN求和 Σ h_uMLP((1+ε)h_v + AGG)单射,达 1-WL 表达上界

关键机制表格

机制 / 维度设计选择动机关键超参
节点特征118 维元素 one-hot最小化手工特征工程dim = 118
图卷积深度2–3 层避免过平滑L ∈ {2,3}(具体值未公开)
归一化GraphNorm图级批统计,适配变长图
残差连接每层后缓解深层退化
读出(池化)全局均值;GIN 用求和均值对图大小不变;求和保留 GIN 单射性⚠ 与层类型混淆
指纹分支ECFP4 1024-bit → FC引入拓扑先验radius=2, nbits=1024
融合方式拼接 concat(G, F)最简单的融合⚠ 未做消融
优化Adam + MSE,100 epoch,早停 patience=10lr 未公开
划分随机 80/10/10与 MoleculeNet 推荐一致⚠ 划分固定,非交叉验证
重复n = 3报告 mean ± SD⚠ 见 §2.5.5
未公开项中最要命的是 F_embed 投影维度。GNN-FP 的融合是拼接。如果 F_embed 维度远大于 G_embed,指纹分支会在拼接向量中占据主导,2 层 MLP 需要额外容量才能平衡两路信号——这恰好是一个能解释「CKA 说互补、实验说无效」矛盾的机制性假设,但因维度未公开而无法验证。已公开的是硬件(RTX A6000 48GB、64 核 CPU、315GB RAM)与训练协议;未公开的是隐藏维度、学习率/dropout 搜索网格、逐数据集最优超参、F_embed 维度、训练时间数值。

2.5 实验设计与定量结果

2.5.1 基准与数据集

五个数据集,覆盖三个应用域,规模跨度 6.5 倍:

数据集分子数测试集(10%)预测目标
ESOL1,028~103物理化学水溶性 log S
FreeSolv642~64物理化学水合自由能
Lipophilicity4,200~420物理化学logD
B3DB1,058~106生物血脑屏障通透性 logBB
RT1,400~140分析化学HILIC 保留时间

数据集选择有一处值得称道的设计:跨越三个性质截然不同的域。ESOL/FreeSolv/Lipophilicity 是「局部可加」性质(大体可由片段贡献叠加),B3DB 是「全局药效团依赖」性质,RT 是「色谱相互作用」性质。这个跨域设计使得 §2.5.3 的发现成为可能——尽管论文自己没有利用它。

2.5.2 主结果矩阵(Table 2 · RMSE ± SD · n=3)

方法B3DBESOLFreeSolvLipophilicityRT
LR1.426 (0.000)4.380 (0.000)2.116 (0.000)1.011 (0.000)601.600 (0.000)
SVM0.471 (0.000)1.128 (0.000)1.512 (0.000)0.730 (0.000)120.555 (0.000)
RF0.550 (0.002)1.569 (0.009)2.572 (0.015)0.950 (0.001)103.548 (0.456)
XGB0.580 (0.001)1.615 (0.003)2.420 (0.006)1.057 (0.001)108.227 (0.387)
GCN0.518 (0.007)0.808 (0.030)1.288 (0.104)0.664 (0.010)96.170 (2.743)
GAT0.552 (0.011)0.808 (0.081)1.736 (0.061)0.639 (0.028)94.734 (4.295)
GIN0.555 (0.011)0.772 (0.044)1.461 (0.176)0.672 (0.020)92.344 (3.042)
GraphSAGE0.542 (0.011)0.762 (0.041)1.352 (0.071)0.629 (0.006)89.477 (1.067)
GCN-FP0.508 (0.007)1.000 (0.030)1.346 (0.064)0.794 (0.017)94.879 (1.925)
GAT-FP0.525 (0.014)0.979 (0.078)1.355 (0.081)0.682 (0.016)88.417 (1.662)
GIN-FP0.549 (0.020)0.814 (0.015)1.022 (0.067)0.699 (0.011)91.739 (0.908)
GraphSAGE-FP0.529 (0.011)0.969 (0.012)1.247 (0.064)0.724 (0.013)89.927 (1.361)
SOTA(外部)0.560.531.020.55MAE 70.40 ⚠

SOTA 归属:B3DB ← GMC-MPNN (Nguyen 2026);ESOL/FreeSolv/Lipophilicity ← MolGraph-xLSTM (Sun 2025);RT ← GNN-TL (Yang 2021)。RT 的 SOTA 值存在严重问题,见 §2.7 第 ① 条。

派生量 1 · 跨数据集平均排名(1 = 12 方法中最优)

#方法平均排名各数据集排名 (B3DB/ESOL/FreeSolv/Lipo/RT)
1GraphSAGE3.006 / 1 / 5 / 1 / 2
2GCN4.003 / 3 / 3 / 3 / 8
3GAT-FP4.604 / 7 / 6 / 5 / 1
3GIN-FP4.607 / 5 / 1 / 6 / 4
3GraphSAGE-FP4.605 / 6 / 2 / 7 / 3
6GIN5.6010 / 2 / 7 / 4 / 5
7GAT6.009 / 4 / 9 / 2 / 6
7GCN-FP6.002 / 8 / 4 / 9 / 7
9SVM7.401 / 9 / 8 / 8 / 11
10RF9.808 / 10 / 12 / 10 / 9
11XGB11.0011 / 11 / 11 / 12 / 10
12LR11.4012 / 12 / 10 / 11 / 12

派生量 2 · 与 SOTA 的真实差距

论文摘要称「我们的 GNN 模型在三个数据集上取得优于或相当于当前 SOTA 的性能」。这句话字面成立,但它省略的部分更重要:

数据集本文最优数值声称 SOTA差距判定
B3DBGCN-FP0.5080.56−9.3%✅ 优于
FreeSolvGIN-FP1.0221.02+0.2%⚖ 持平
ESOLGraphSAGE0.7620.53+43.8%❌ 显著劣于
LipophilicityGraphSAGE0.6290.55+14.4%❌ 劣于
RTGIN (MAE)63.783MAE 70.40−9.4% ⚠⚠ SOTA 值本身有误
这是全文最需要读者自己算出来的数字。5 个数据集中,明确优于 SOTA 的只有 1 个(B3DB),持平 1 个(FreeSolv,差距 0.002 仅为其自身标准差 0.067 的 3.0%,统计上毫无意义),明确劣于 SOTA 的有 2 个,其中 ESOL 落后 43.8%。摘要通过「三个数据集」的措辞,把 1 胜 1 平 2 负(+1 存疑)的战绩表述成了正面结论。

需要公平地指出:对一篇基准论文而言,跑不过 SOTA 本身不是缺陷——基准的价值在公平对照,不在刷榜。真正的问题是摘要采用了刷榜论文的话术。若摘要写「标准架构在物理化学数据集上距专用 SOTA 有 14–44% 的差距,但在生物与分析化学数据集上可持平或超越」,既诚实又更有信息量。

图 1 · 指纹融合增益按数据集完美分层(论文未做的派生矩阵)

各数据集上 4 个架构的 (GNN-FP − GNN)/GNN 均值。负值 = 指纹带来改善。数据源:Table 2,20 个架构-数据集配对单元。

指纹有效(融合降低 RMSE) 指纹有害(融合抬高 RMSE)
−16% −8% 0 +8% +16% +24% FreeSolv (3/4) B3DB (4/4) RT (3/4) Lipophilicity (0/4) ESOL (0/4) −13.81% −2.58% −2.04% +11.36% +19.38%

2.5.3 指纹融合分析(派生矩阵,论文未做)

论文的结论是:「指纹与图嵌入本质上是非互补的,除 FreeSolv 外未见性能增益。」我把 Table 2 中 4 架构 × 5 数据集 = 20 个配对单元的融合增益全部算出(负值 = 改善):

架构B3DBESOLFreeSolvLipophilicityRT
GCN−1.93%+23.76%+4.50%+19.58%−1.34%
GAT−4.89%+21.16%−21.95%+6.73%−6.67%
GIN−1.08%+5.44%−30.05%+4.02%−0.66%
GraphSAGE−2.40%+27.17%−7.77%+15.10%+0.50%
列均值−2.58%+19.38%−13.81%+11.36%−2.04%
有效比例4/40/43/40/43/4
论文的结论是错的,或至少被错误地泛化了。融合在 20 个单元中的 10 个带来改善——正好一半。更重要的是,改善与否几乎完美地按数据集分层,而非按架构分层,且该分层与 §2.5.1 的域划分精确重合
  • 指纹有效:B3DB(生物,4/4)、RT(分析化学,3/4)、FreeSolv(最小数据集,3/4)
  • 指纹有害:ESOL(物理化学,0/4,+19.38%)、Lipophilicity(物理化学,0/4,+11.36%)

可检验的假设:ECFP4 编码的是子结构存在性(药效团式信息)。当目标性质依赖全局药效团特征(血脑屏障通透性、色谱相互作用)或训练数据极少时,它提供了 GNN 从小数据学不到的先验;当目标性质是局部可加的物理化学量(溶解度、logD)时,GNN 的消息传递本就能高效学到,此时 1024 维稀疏指纹只是引入噪声与过拟合风险。

论文把这个有结构、有解释力的现象压缩成了一句「非互补」。这是全文信息损失最严重的一处。

图 2 · ⚡ 相变现象:架构选择的效应量是场景依赖的

纵轴为「最优架构 vs 最差架构」的相对性能跨度 (max−min)/max。前五项为从头训练(Table 2),末项为迁移学习完全微调(Table 4,同为 RT 数据集)。

从头训练 迁移学习(完全微调)
0 8% 16% 24% 32% ESOL Lipophilicity B3DB RT FreeSolv RT(迁移) 5.7% 6.4% 6.7% 7.0% 25.8% 30.0% 测试集仅 64 分子

2.5.4 迁移学习与相变现象(Table 4 · MAE · RT 数据集)

预训练:METLIN(80k SMILES,反相色谱 RT)。微调:RT 数据集(1,400 条,HILIC)。三级微调粒度:

层类型仅回归头FC 投影 + 回归头完全微调头→完全 改善
GCN93.725 (1.716)82.737 (1.119)75.621 (3.456)−19.3%
GAT91.323 (5.436)83.671 (3.974)72.195 (1.112)−20.9%
GraphSAGE84.543 (1.924)75.237 (0.264)70.752 (2.750)−16.3%
GIN60.960 (0.158)55.011 (0.474)52.914 (1.218)−13.2%
⚡ 全文最有说服力的定量证据。在 5 个从头训练场景中的 4 个,架构跨度稳定在 5.7–7.0% 的窄带内;一旦进入迁移场景,同一数据集(RT)上的跨度从 7.0% 跃升到 30.0%——放大 4.3 倍。唯一的从头训练例外是 FreeSolv(25.8%),而它恰好是最小数据集(测试集仅 64 条),大跨度更可能来自小样本方差而非真实架构差异。

因此论文的核心主张需要修正为一个更精确、更可操作的版本:在从头训练时,层类型的调优收益(~6%)可能不值得四倍的搜索成本;但在任何涉及预训练/迁移的流水线中,不扫层类型就是在桌上留下 30% 的性能。

GIN 为何在迁移下胜出?论文未作解释。一个与 Xu et al. (2019) 理论一致的假设是:GIN 的求和聚合是单射的,达 1-WL 表达上界,能保留最丰富的结构信息。这种表达能力在小数据从头训练时是负担(易过拟合,故 GIN 在 B3DB 上排名第 10),但在 80k 分子上预训练时可被充分利用。这个假设可用一个便宜的实验证伪:在 METLIN 预训练规模上做 10k/40k/80k 缩放曲线,看 GIN 的相对优势是否随预训练规模单调扩大。

图 3 · 三级微调粒度下的四种架构,以及 RT 基线数值的自相矛盾

纵轴 MAE(越低越好)。两条虚线分别是论文 Table 2 记录的 SOTA(70.40)与论文正文所述的同一基线(38.6)——同一篇论文对同一基线给出了相差 82% 的两个数字。

仅回归头 FC 投影 + 回归头 完全微调 GNN-TL 基线(两个版本)
0 25 50 75 100 MAE Table 2 所记 SOTA = 70.40 ⚠ 论文正文所述 同一基线 = 38.6 GCN GAT GIN GraphSAGE 若正文的 38.6 为真值,则全部 12 个配置无一超越基线,最好的 GIN 完全微调仍落后 37.1%

2.5.5 统计显著性(论文未做,本报告补算)

论文报告了 n=3 的标准差,但从未做过任何显著性检验,却在正文中反复使用「最优架构」的表述。双样本 t 检验(df=4,α=0.05,tcrit=2.78),检验每个数据集上「最优 vs 次优」架构的差距:

数据集最优次优差距t 统计量判定
B3DBGCN 0.518±0.007GraphSAGE 0.542±0.0110.0243.19✅ 显著
ESOLGraphSAGE 0.762±0.041GIN 0.772±0.0440.0100.29❌ 不显著
FreeSolvGCN 1.288±0.104GraphSAGE 1.352±0.0710.0640.88❌ 不显著
LipophilicityGraphSAGE 0.629±0.006GAT 0.639±0.0280.0100.60❌ 不显著
RTGraphSAGE 89.477±1.067GIN 92.344±3.0422.8671.54❌ 不显著
5 个数据集中,只有 1 个(B3DB)的「最优架构」在统计上确实优于次优。其余 4 个数据集上,宣称的架构排序完全落在噪声范围内。这直接动摇了摘要的核心断言「GCN 和 GIN 是分子图回归任务的最优 GNN 架构」。

方差来源的隐忧:LR 与 SVM 的 SD 恰为 0.000。这两个模型是确定性的,SD 为 0 意味着三次重复共享同一数据划分。因此所有 GNN 的 SD 只捕捉权重初始化的随机性,完全没有捕捉划分随机性——而在 FreeSolv(测试集 64 分子)这样的规模下,划分方差几乎必然主导。这意味着连那唯一「显著」的 B3DB 结果也建立在被低估的不确定性之上。

迁移学习结果不受此影响:GIN 52.914±1.218 vs GraphSAGE 70.752±2.750,差距 17.8 是合并标准差的 8 倍以上。这再次说明:论文真正稳固的发现在迁移部分,而摘要的重心却放在了不稳固的从头训练部分。

2.5.6 预测质量:高误差分子比例(Table 3,%)

方法B3DBESOLFreeSolvLipophilicityRT
LR50.94383.18667.69254.76280.714
SVM18.86853.98241.53836.90548.571
RF30.50377.58175.89752.38160.714
XGB33.64877.87669.23160.15968.095
GCN25.47242.47832.30837.38136.905
GAT25.15746.01838.97438.09540.476
GIN27.67337.46338.46237.38132.381
GraphSAGE30.81840.70850.76935.71440.238
  1. B3DB 上 SVM 以 18.868% 的高误差率大幅优于所有 GNN(最好的 GAT 为 25.157%,相对高出 33.3%)。结合 Table 2 中 SVM 的 RMSE 0.471 也是全表最优,B3DB 上传统 ECFP4+SVM 在两个判据上同时击败了全部 8 个 GNN 变体。而论文结论段写道「GNN 模型能给出优于用固定长度分子指纹训练的 ML 模型的性能」——这一断言被论文自己的数据在 1/5 的数据集上直接证伪,论文正文只以「except for the B3DB dataset」一笔带过。B3DB 恰是唯一的生物属性数据集,这个反例本身就是有价值的发现,却被当作噪声处理了。
  2. Table 3 完全没有 GNN-FP 的行。论文宣称的四判据之一是「预测质量」,而「指纹非互补」的结论横跨全文——但融合模型的预测质量从未被评估。完全可能出现的情况是:GNN-FP 虽然 RMSE 没改善,却降低了高误差分子比例(改善了误差分布的尾部而非中心)。这是一个成本为零的缺失实验(模型已训练完毕)。

2.6 价值分析

真正的贡献

不是「做了一次 GNN 基准测试」——这类基准每年都有。:把「底层层类型」这个变量从背景常量提升为可测量的实验对象,并(在迁移学习子场景里)给出了它值 30% 性能的证据。这个证据的力量在于它是在完全受控的条件下取得的——同一数据、同一预训练语料、同一微调协议、同一回归头,只换一个 AGG/UPD 函数。

可脱离本文单独复用的设计

  1. 「高误差分子」分析范式。把评估从「平均误差多大」转向「误差落在哪类分子上」。论文用 RDKit 描述符对比高/低误差子集,得到「GNN 在 5 个数据集中的 3 个上,环数在高低误差组间显著不同」这一可操作的适用边界。与本文的具体结论无关,可直接迁移到任何分子回归任务的模型诊断中。
  2. CKA 作为融合有效性的前置探针。「先测两路表示的互补性,再决定要不要融合」这个流程本身是省算力的好习惯——即使本文证明了 CKA 低不等于融合有效(这本身就是有价值的负面结论)。
  3. 三级微调粒度协议。比常见的「冻结 vs 全微调」二分更细,能分离「表示可用性」与「表示可适配性」。从 Table 4 看,GIN 的「头→全」改善幅度最小(13.2%)恰恰说明它的预训练表示本身质量最高——仅用一个线性头就达到 60.960,比其他架构完全微调后还好。这个诊断逻辑值得复用。
  4. 跨域数据集选择(物理化学 / 生物 / 分析化学)。这个设计使 §2.5.3 的域依赖性发现成为可能。后续做指纹融合或表示互补性研究的工作应直接继承这个三域配置。

对后续工作的启发

2.7 局限性

第一类:论文自述的限制(Conclusion 章节)

  1. 大分子失效:「与 ML 模型可以生成固定尺寸指纹不同,GNN 模型在大型复杂分子上表现出较低的预测性能。」(Figure 4 支撑:环数在 3/5 数据集上于高低误差组间显著不同)
  2. 训练成本:「GNN 模型的训练时间显著高于 ML 模型,在资源受限环境下可能存在可扩展性问题。」(Figure 3)
  3. 指纹非互补:「指纹与图嵌入在本质上是非互补的,除 FreeSolv 数据外未见性能增益。」(本报告 §2.5.3 认为这一自述结论本身有误)
  4. 迁移域偏移(§3.5):「我们使用的 METLIN 是反相色谱,其分布完全不同 [与 HILIC 相比]。」

第二类:补充批判(独立观察,8 条)

① [论证缺口 / 事实错误] RT 数据集的 SOTA 基线数值与论文自身正文相互矛盾,导致该数据集的所有比较结论失效。

论文 Table 2 将 RT 的 SOTA 列为 MAE = 70.40,归属于 GNN-TL (Yang et al., 2021)。但论文正文另有一句原文:

"GNN-TL achieved a MAE of 38.6 on the hold-out test set for RT data after fine-tuning."

同一篇论文的表格与正文,对同一个基线给出了 70.40 和 38.6 两个相差 82% 的数字。采用哪个数字,会完全颠覆结论:

本文结果vs Table 2 的 70.40vs 正文的 38.6
GIN 从头训练 MAE 63.783−9.4%(胜)+65.2%(惨败)
GIN 完全微调 MAE 52.914−24.8%(大胜)+37.1%(负)
GraphSAGE 完全微调 70.752+0.5%(持平)+83.3%(惨败)
GCN 完全微调 75.621+7.4%(负)+95.9%(惨败)

摘要中「GIN with MAE of 63.783 on RT datasets」作为三项超越 SOTA 的成就之一被列出——若正文的 38.6 是正确值,这项成就实为落后 65.2%。

需要为论文说一句公道话:论文确实指出 GNN-TL 使用了 305k 同域 in-silico HILIC 数据预训练,而本文使用 80k 异域 METLIN 反相色谱数据,两者预训练条件不可比。但这恰恰意味着不应把 GNN-TL 列为可比 SOTA 并宣称超越它。正确做法是要么在同域数据上重做预训练,要么把 GNN-TL 标注为「不可比参考」。目前的呈现方式——表格里放一个数、正文里放另一个数、摘要引用有利的那个——无论是否有意,效果都是误导性的。

② [统计有效性] 4/5 数据集上宣称的「最优架构」不具统计显著性,且方差估计本身系统性偏低。

§2.5.5 已详述:只有 B3DB 一个数据集的最优 vs 次优差距显著(t=3.19 > 2.78),其余 4 个 t 值在 0.29–1.54 之间。而摘要断言「GCN 和 GIN 是最优 GNN 架构」。更深一层:LR/SVM 的 SD 恰为 0.000,证明三次重复共享同一划分,因此报告的 SD 只反映初始化方差、不含划分方差。这意味着连那唯一「显著」的 B3DB 结果也建立在被低估的不确定性之上。

③ [论证缺口] 核心结论「指纹非互补」被本文自己的数据证伪,且错失了一个有解释力的发现。

§2.5.3 已详述:融合在 20 个单元中的 10 个带来改善(50%),且改善与否按数据集完美分层——B3DB 4/4、RT 3/4、FreeSolv 3/4 有效;ESOL 0/4、Lipophilicity 0/4。论文将这个有结构的现象概括为「非互补,除 FreeSolv 外无增益」,既不准确(漏掉 B3DB 与 RT 的一致增益),也丢失了「指纹在生物/分析化学终点上有效、在物理化学终点上有害」这个可解释、可预测的规律。

④ [论证缺口] 「CKA 低但融合无效」的矛盾被标记为「反直觉」后即被搁置,而它恰恰指向可检验的机制假设。

至少有三个可检验的解释,本文一个都没有测试:

对第一个假设的忽略尤其可惜。FP-GNN(Cai et al. 2022)——本文 Table 1 明确列出的先驱工作——用的是三种互补指纹(MACCS + PubChem + Pharmacophore ErG)而非单一 ECFP4。本文用单一指纹得出的「非互补」结论,无法反驳 FP-GNN 用多指纹得出的「互补」结论,因为两者的指纹配置根本不同。这是一次未成立的反驳。

⑤ [实验设计混淆] GIN 使用求和池化而其余三者使用均值池化,使「架构效应」与「池化效应」完全无法分离。

论文自己承认了这个混淆——在解释「GIN 与其他架构 CKA 低」时写道:「可能是由于池化公式的差异(GIN 用 add 池化,其他 GNN 用 mean 池化)。」但这个混淆污染的不只是 CKA 分析,而是全文所有涉及 GIN 的结论,包括最重要的迁移学习结果。GIN 52.914 vs GCN 75.621 这个 30% 的差距,无法判断有多少来自单射聚合、多少来自求和池化——而求和池化保留了图规模信息,RT 保留时间恰恰与分子大小强相关,这是一个高度合理的替代解释。修复成本极低:跑 GIN+mean 与 GCN+add 两个对照,2×5 = 10 组额外实验。这是全文最该做而未做的消融。

⑥ [术语误用] 将「仅微调回归头」称为 zero-shot learning。

论文原文:「Even with zero-shot learning (fine-tuning MLP regression head), MAE of 60.960 was achieved.」微调一个回归头需要在目标数据上做梯度更新,这是标准的 linear probing(线性探针),不是 zero-shot。这个误用会让引用本文的后续工作产生错误的性能预期——真正的 zero-shot 数值(直接用 METLIN 预训练模型在 HILIC 上推理)论文根本没有报告,而那个数字才是回答「表示能否跨色谱模式直接迁移」的关键。

⑦ [覆盖缺口] 四判据之一的「预测质量」从未在 GNN-FP 模型上评估。

Table 3 只有 8 行(4 ML + 4 纯 GNN),缺失全部 4 个 GNN-FP 变体。而「指纹非互补」是贯穿全文的结论之一。在药物发现中,避免灾难性预测往往比平均精度更有价值——这 4 行数据的计算成本为零,却缺失了。

⑧ [可复现性风险] 声明的代码仓库无法定位,且论文标题在版本间发生变更。

v3 正文声明数据与代码可在 github.com/rajanbit/MolGraphBench 获取。经多种检索策略(仓库名精确匹配、站内检索、作者名关联检索)均未能定位该仓库,而同一作者的其他仓库可正常检索到。同时 v2 正文写的是「可向作者合理索取」,并无仓库。叠加标题变更,判断是该仓库很可能尚未公开或已失效。结合超参搜索空间、逐数据集最优超参、F_embed 维度、训练时间四项关键信息全部只存在于代码/补充材料中,本文目前实质上是不可复现的。

必须声明的自我限制:我无法直接访问 GitHub 做 404 确认(本环境网络出口受限,仅能通过搜索引擎间接检索),因此不排除该仓库存在但未被搜索引擎索引的可能。这条批评的置信度低于前七条,读者应自行访问确认。

3 · 相关工作回溯(问题传递链)

沿本文的引用脉络与问题继承关系,选取 5 篇构成一条完整的问题传递链。这不是五个平行的工作总结,而是一条「分子图学习如何一步步把『架构选择』这个变量丢失、又如何被重新捡起」的历史。

3.1 Neural Message Passing for Quantum Chemistry — 2017.04 · ICML 2017(主会)

解决了什么问题。在 MPNN 之前,分子图上的神经网络是一堆彼此孤立的方法:Duvenaud 的神经指纹、Kearnes 的图卷积、Li 的 GGNN 各说各话,无法比较。Gilmer 等人的贡献是提出统一抽象——所有这些方法都可以写成「消息函数 M + 更新函数 U + 读出函数 R」的三段式。核心贡献一句话:把分子图神经网络从一堆技巧统一成一个有明确设计维度的架构族。最佳集成模型在 QM9 全部 13 个目标上取得当时 SOTA,其中 11/13 达到化学精度。

遗留了什么缺口。MPNN 定义了设计空间,却没有给出在这个空间里如何选点的任何指导。论文探索了若干 M/U/R 变体,但只在 QM9 单一数据集(且是高度理想化的小有机分子量子化学数据)上。留下的空白是:当任务从 QM9 换成实验测量的溶解度、通透性、保留时间时,设计空间里的最优点会不会移动?MPNN 从未回答,后续十年也几乎没人系统地问过。

核心论文的回应。MolGraphBench 直接在这个空白上工作。它固定了 MPNN 框架中除 M/U 之外的一切(同样的 118 维原子特征、同样的 FC 投影、同样的 GraphNorm+残差、同样的 2 层 MLP 头),只让 M/U 在四个已知实例间变化,然后在五个实验测量数据集上测量这个变化的效应量。这正是 MPNN 论文应该做但没做的那个实验。

关键设计的传递。MPNN 的三段式抽象在本文中原封不动地成为实验的控制骨架——正是因为 M/U/R 可分离,「只换层类型、其余全同」这个受控实验才在工程上可行。但传递中丢了一样东西:MPNN 把 R(读出)也当作设计维度,而本文把 R 固定为均值池化——唯独 GIN 例外用了求和。这个不彻底的固定,正是 §2.7 第 ⑤ 条混淆的根源。

3.2 MoleculeNet: A Benchmark for Molecular Machine Learning — 2018.01 · Chemical Science

解决了什么问题。2018 年前,分子机器学习论文各用各的数据、各划各的训练测试集,横向比较不可能。MoleculeNet 提供 17 个数据集、逾 70 万化合物、逾 800 个任务的统一集合,配套 DeepChem 实现和推荐划分。本文使用的 ESOL(1,128)、FreeSolv(643)、Lipophilicity(4,200)均出自此。核心贡献一句话:给分子机器学习装上了共同的度量衡。

遗留了什么缺口。MoleculeNet 统一了数据,却在无意中固化了一种评测文化:一篇论文的价值 = 它在这几张表上把 RMSE 降低了多少。架构、超参、划分这些维度被压缩进「我们的方法」这个黑盒里,只有最终数字被拿出来比较。这直接导致了本文 Table 1 所描述的局面——十余种「新架构」各自宣称提升,却无人知道提升来自哪个组件。

一处需要澄清的常见误传,以及我的自我修正。MoleculeNet 对 ESOL/FreeSolv/Lipophilicity 这三个物理化学回归数据集,Table 1「Rec-split」列推荐的正是随机划分(Random);scaffold 划分主要推荐给 BBBP、Tox21 等生物活性分类数据集。而作为对比基线的 MolGraph-xLSTM(Commun. Chem. 2025)对这三个回归数据集同样使用 8:1:1 随机划分结论:本文与其 SOTA 基线的划分协议是一致的,这个比较在划分维度上是公平的。我在初读时曾把「未用 scaffold 划分」列为批评,核实后撤回——这也是本报告需要坦白的一处自我修正。

核心论文的回应。MolGraphBench 继承 MoleculeNet 的数据与划分,但把评测的因变量换了:不再问「哪个方法 RMSE 最低」,而问「在方法固定的前提下,某个特定设计维度值多少」。同时把数据集从三个物理化学数据集扩展到 B3DB(生物)和 RT(分析化学)——正是这个扩展让 §2.5.3 的域依赖性发现成为可能。

关键设计的传递。从「benchmark = 一组数据集」进化为「benchmark = 一个受控实验设计」。MoleculeNet 的贡献是横轴(数据集),MolGraphBench 试图补上纵轴(受控的架构变量)。

3.3 FP-GNN — 2022.11 · Briefings in Bioinformatics

解决了什么问题。图表示与分子指纹各有所长:GNN 学到任务相关的连续表示,指纹编码专家设计的子结构先验。FP-GNN 提出双通道架构——GAT 分支处理分子图,ANN 分支处理三种互补指纹(MACCS + PubChem + Pharmacophore ErG),在全连接层融合。核心贡献一句话:证明图与指纹可以互补,融合优于任一单独通道。在 13 个基准的 16 个任务中于 7 个取得最佳;LIT-PCBA 平均 AUC 0.739;14 个乳腺癌细胞系数据集平均 AUC 0.849,优于 AttentiveFP、GAT、GCN、MPNN 与 XGBoost。

遗留了什么缺口。FP-GNN 证明了「融合有效」,却没有拆解为什么有效、何时有效。它同时改变了三件事(引入指纹分支、用三种指纹、用 GAT 底层),因此增益无法归因。更关键的是:它从未测试「指纹数量」这个维度——单指纹够不够?也从未测试跨域一致性。

核心论文的回应。MolGraphBench 的 GNN-FP 变体是对 FP-GNN 范式的一次受控复检:把融合从 GAT 一个底层推广到全部四个底层,跨五个数据集测量增益。这是 FP-GNN 未做的归因实验。但这次复检的结论「融合无效」并不成立——因为本文只用了单一 ECFP4(1024-bit),而 FP-GNN 的核心主张恰恰建立在三种互补指纹上。本文误把一个更弱命题的证否,当成了对更强命题的反驳。

关键设计的传递。融合位置的传递是完整的:FP-GNN 在全连接层合并,本文在池化后拼接再进 2 层 MLP——本质相同。丢失的是指纹的多样性维度。而本报告 §2.5.3 的域依赖性发现,恰好为 FP-GNN 的路线提供了新的辩护:指纹在 B3DB(生物)上 4/4 有效,正是 FP-GNN 所专注的生物活性任务类型。

3.4 GNN-TL — 2021.09 · Journal of Chromatography A

解决了什么问题。HILIC 色谱保留时间预测的困境是实验标注极其昂贵,公开数据只有千条量级。GNN-TL 的方案是先在 ~306K 条 in-silico(伪标签)HILIC 保留时间数据上预训练 GNN,再在小规模真实 HILIC 数据上微调。核心贡献一句话:用大规模同域伪标签数据的预训练,突破小样本色谱预测的数据瓶颈。本文使用的 RT 数据集(1,400 分子)及其配套仓库即出自此工作。

遗留了什么缺口。GNN-TL 只用了一种架构。因此它证明的是「迁移学习对这个任务有效」,但迁移增益中有多少属于『预训练』、多少属于『恰好选对了架构』,完全无法分离。此外它的预训练语料是同域 in-silico HILIC——留下另一个问题:如果只有异域数据(如反相色谱),迁移还成立吗?

核心论文的回应。MolGraphBench 的 Table 4 同时回答了这两个问题,而且回答得比论文自己意识到的更有力:

关键设计的传递与断裂。三级微调粒度协议是本文相对 GNN-TL 的方法学改进。但传递中发生了一次严重的记账错误:本文把 GNN-TL 的基线数值在 Table 2 中记为 MAE 70.40,而在正文中又写 38.6(§2.7 第 ① 条)。由于 GNN-TL 用的是同域 306K 预训练、本文用的是异域 80K 预训练,两者本就不应直接对比;把它列为可比 SOTA 并宣称超越,是这条继承链上最不严谨的一环。

3.5 Position: Graph Learning Will Lose Relevance Due to Poor Benchmarks — 2025.02 · ICML 2025 Position Track(主会)

解决了什么问题。这不是一篇方法论文,而是一篇诊断。Bechler-Speicher 等 12 位作者(含 Bronstein、Morris、Perozzi、Galkin)主张:图机器学习正因基准设计不佳而流失领域相关性。具体指控包括——基准过度集中于分子图等狭窄领域而忽视组合优化、芯片设计等高影响场景;数据集代表性差;评测方式碎片化;过度强调单一准确率指标,导致模型过拟合基准而非获得可泛化能力。核心贡献一句话:把「基准质量」本身认定为图学习进步的瓶颈。提出三条方向:更有意义的基准、更严格的评测协议、加强与领域专家协作。

遗留了什么缺口。作为 position 论文,它诊断了病却没开出可执行的处方。「更严格的评测协议」具体意味着什么——多少次重复?哪种划分?是否需要显著性检验?如何控制混淆变量?这些都留给了社区。

核心论文的回应。MolGraphBench 在引言中引用了这篇立场论文,并可被理解为对其号召的一次具体响应:把「评测协议」从「报一个数」升级为「控制变量测效应量」,并把四个判据而非单一 RMSE 作为评价维度。

关键设计的传递——以及一个尖锐的反讽。传递是真实的:多判据评价、跨域数据集、受控变量,都是对 position 论文号召的正面回应。但本文在统计严谨性上恰恰重蹈了它试图批评的覆辙——n=3 且固定划分、无显著性检验、在 4/5 数据集上从噪声中读出「最优架构」的结论。position 论文批评社区「过度强调单一准确率指标」,而本文的摘要依然在用「我们在三个数据集上优于或相当于 SOTA」的刷榜话术。

这个反讽不是为了贬低本文,而是指向一个真实的元问题:呼吁更好的基准是容易的,执行严格的评测协议是困难的,因为后者需要的是纪律而非洞见。本文的价值恰恰在于,它离那个标准足够近,以至于它与标准的差距是可以被精确测量的——这正是本报告 §2.7 所做的事。

4 · 技术演进脉络

4.1 演进树

2017 MPNN [Gilmer, ICML] 定义 M/U/R 三段式设计空间 · QM9 上 11/13 达化学精度 ↓ 留下:设计空间有了,但「如何选点」无人回答 │ 2017–2019 四种层类型平行诞生(均非分子领域专用) ├─ GCN [Kipf&Welling, ICLR'17] 度归一化均值 · 谱域动机 ├─ GraphSAGE [Hamilton, NeurIPS'17] 自身/邻居分离编码 · 归纳式 ├─ GAT [Veličković, ICLR'18] 注意力加权 · 邻居自适应 └─ GIN [Xu, ICLR'19] 求和聚合 · 单射 · 1-WL 表达上界 ↓ 这四个点被后续工作「任选一个」作为底座,从此成为背景常量 │ 2018 MoleculeNet [Wu, Chem. Sci.] 17 数据集 / 70万化合物 · 统一度量衡 · 物化回归推荐随机划分 ↓ 统一了数据,却固化了「比 RMSE 数字」的评测文化 │ ├──────────────────┬───────────────────┬──────────────────┐ ↓ ↓ ↓ ↓ 2021 GNN-TL 2022 FP-GNN 2024 CKA探针 2025 MolGraph-xLSTM [J.Chrom.A] [Brief.Bioinform] [Welsch, JCIM] [Commun.Chem.] 306K同域预训练 GAT + 三种互补指纹 表示相似度度量 xLSTM+MoE 双层级 补「数据效率」 补「先验融合」 补「可解释性」 补「表达能力」 ⚠ 仅单一架构 ⚠ 三改动无法归因 ⚠ 仅度量不预测 ⚠ 增益未拆解 │ │ │ │ └──────────────────┴───────────────────┴──────────────────┘ ↓ 四条线各补一个维度,但全部把「底层层类型」当作已定常量 │ 2025 Position: 图学习将因劣质基准失去相关性 [Bechler-Speicher, ICML Position] 诊断:评测碎片化、过度依赖单一指标、模型过拟合基准 ↓ 开出了病历,没开出处方 │ 2026 MolGraphBench [arXiv:2602.20573v3] ◄─── 汇聚点 把「层类型」从背景常量提升为受控实验变量 · 4 层类型 × 5 数据集 × {纯 / +指纹} × {从头 / 三级迁移} · 借用 CKA 作互补性前置探针(继承 Welsch) · 引入「高误差分子」分布式评估(新增) 结论:层类型应作为可调超参 ⚠ 但自身在 4/5 数据集上无统计显著性,重蹈 position 论文批评之覆辙 │ ↓ 本报告的派生发现(论文未觉察) 2026 【相变】层类型效应量是场景依赖的: 从头训练 ~6%(4/5 数据集稳定于 5.7–7.0%) 迁移学习 ~30%(同一 RT 数据集上跨度放大 4.3 倍)

4.2 演进的内在逻辑线索

推动力:从「能不能学」到「学什么」再到「谁在学」

阶段间的关键转折

第一个转折在 2018:MoleculeNet 之后,评价从「我在自己的数据上有效」变成「我在共同的表上数字更低」。这是巨大的进步,代价是把多维的设计选择压缩成了一维的排行榜坐标。

第二个转折在 2025–2026,正在发生:从「优化排行榜位置」转向「审计排行榜有效性」。MolGraphBench、Bechler-Speicher 的 position 论文、以及同期涌现的一批评测框架(LeMat-GenBench、AtomBench、NewtonBench)共同构成这个转折。这个转折的特征是元级化——研究对象从模型变成了研究方法本身。

社区关注点的转移轨迹

准确率(2017–2020)→ 数据效率与预训练(2020–2023)→ 可解释性与表示分析(2023–2025)→ 归因有效性与评测协议(2025– )

MolGraphBench 处在最后这个阶段的开端,它的不完善(统计不严、混淆未控、记账出错)恰恰是这个阶段早期的典型特征:问题意识已经到位,方法论纪律尚未跟上。

5 · 相关工作表格对标

工作年月会议 / 出版核心贡献主要指标与核心工作的关系
MPNN2017.04ICML 2017(主会)M/U/R 三段式统一框架QM9 13 目标全 SOTA;11/13 达化学精度提供本文的受控实验骨架;本文补上其未做的「设计空间选点」实验
GCN / GraphSAGE / GAT / GIN2017.02 / 2017.06 / 2017.10 / 2018.10ICLR'17 / NeurIPS'17 / ICLR'18 / ICLR'19四种 AGG/UPD 实例非分子领域基准本文的四个被试对象;本文首次在分子回归上做受控对比
MoleculeNet2018.01Chemical Science17 数据集 / 70万化合物统一基准ESOL 1,128 / FreeSolv 643 / Lipo 4,200;物化回归推荐随机划分提供本文 3/5 数据集与划分协议;本文把因变量从「方法」换成「设计维度」
GNN-TL2021.09J. Chromatogr. Ain-silico 预训练 + 微调破解 HILIC 小样本306K 同域预训练;原文自报 MAE 38.6(本文 Table 2 记为 70.40 ⚠)提供本文 RT 数据集;本文将其单架构迁移推广至四架构,并揭示 30% 架构跨度
FP-GNN2022.11Brief. Bioinform.GAT + 三种互补指纹双通道融合16 任务中 7 项最佳;LIT-PCBA AUC 0.739;细胞系 AUC 0.849本文 GNN-FP 的直接前驱;本文用单一 ECFP4 得出的「非互补」结论不足以反驳其多指纹主张
CKA 分子嵌入2024.10JCIM 64:7303把 CKA 引入化学信息学提出适配非旋转不变模型的 CKA;caveat:结果依赖核函数选择本文 CKA 分析的方法来源;本文用它得到 0.27–0.59 的读数,却未解决由此产生的矛盾
Position: Poor Benchmarks2025.02ICML 2025 Position Track认定基准质量为图学习瓶颈不适用(观点论文)本文的直接动机来源;本文是其号召的具体响应,但在统计严谨性上重蹈其所批评之覆辙
MolGraph-xLSTM2025.09Commun. Chem. 8:286原子级+基序级双层 xLSTM + 多头 MoEESOL 0.527±0.046、FreeSolv 1.024±0.076、Lipo 0.550±0.026;随机划分 8:1:1,n=3本文 3 个数据集的 SOTA 基线;划分协议与本文一致,比较公平;本文最优模型在 ESOL 上落后其 43.8%
MolGraphBench2026.02
(v3: 2026.06)
arXiv 预印本把层类型从背景常量提升为受控实验变量B3DB 0.508(−9.3%)· FreeSolv 1.022(持平)· ESOL 0.762(+43.8%)· Lipo 0.629(+14.4%)· 迁移 GIN MAE 52.914汇聚点;四条演进线在此被统一到一个受控实验设计下
表格读法。纵向看,性能趋势并非单调上升——MolGraph-xLSTM (2025) 在 ESOL 上 0.527 优于 MolGraphBench (2026) 的 0.762。这不是退步,而是两类论文的目标不同:前者优化排行榜,后者审计归因。把它们放在同一列比较本身就是 MoleculeNet 遗留的评测文化在起作用——而这恰恰是本文试图挑战的东西。

6 · 开放挑战与研究机会

6.1 理论层面

① 架构表达能力与迁移收益的定量关系。不是笼统的「研究表达能力」,而是:GIN 的 1-WL 表达上界与其迁移优势之间是否存在可测量的函数关系?具体实验:固定 RT 下游任务,在 METLIN 上以 {5k, 10k, 20k, 40k, 80k, 160k} 六个规模预训练四种架构,绘制「预训练规模 × 架构间性能跨度」曲线。可证伪的预测:若表达能力假设成立,GIN 的相对优势应随预训练规模单调扩大;若在某规模后平台化,说明优势来自别处(如求和池化保留的图规模信息)。高价值低门槛——所需算力约为本文全部实验的 1.5 倍。

② 条件互补性度量的构造。CKA 度量的是两个表示的边际差异,而融合收益取决于条件于标签的差异。需要一个新量:CI(A,B;y) = I(B;y | A) 的可估计代理——「在已知表示 A 的前提下,表示 B 还能提供多少关于 y 的信息」。路线:用 MINE 或 InfoNCE 估计条件互信息,在本文的 20 个单元上验证它能否预测 §2.5.3 的融合增益符号。如果能,这个度量将成为所有多模态分子模型的前置筛选工具。

③ 池化算子的独立效应。一个纯粹的 2×4 析因实验:{mean, sum} 池化 × {GCN, GAT, GIN, GraphSAGE},在五个数据集上跑。唯一目的是把 §2.7 第 ⑤ 条的混淆拆开。成本 10–40 组实验,收益是让本文(以及所有把 GIN 作为底座的工作)的结论变得可归因。

6.2 工程与应用层

④ 域感知的指纹融合策略。§2.5.3 给出了可直接落地的规则草案:在生物终点(通透性、毒性、活性)与色谱/分析终点上启用指纹融合;在局部可加的物理化学终点(溶解度、logD、自由能)上禁用。验证实验:在 MoleculeNet 全部 17 个数据集上按域分层重跑 4 架构 × {纯, +FP},检验「域 → 融合有效性」映射是否稳定。若稳定,可固化为工程默认值。

⑤ 融合机制的消融。在固定 ECFP4 的前提下对比四种融合方式——朴素拼接(本文)、门控融合、交叉注意力、残差式(指纹分支只预测 GNN 的残差)。关键控制:F_embed 与 G_embed 维度必须严格配平。预期结果:若残差式融合在 ESOL 上把 +23.76% 的劣化翻转为改善,则证明问题出在融合方式而非互补性本身。

⑥ 评测协议的最小可接受标准。社区需要一个明确的清单,而非「更严格的协议」这种号召。草案:(a) 至少 5 折交叉验证 × 3 种子 = 15 次运行,报告划分方差与初始化方差的分解;(b) 任何「A 优于 B」的断言必须附检验统计量;(c) 所有 baseline 的超参搜索预算必须与自有方法相同并公开;(d) SOTA 引用必须注明其划分协议、预训练语料与指标定义。本文若满足 (a) 与 (b),其 4/5 数据集上的架构结论就不会被提出。

⑦ 大分子失效的机制定位。论文观察到「环数在 3/5 数据集上于高低误差组间显著不同」,但停在了相关性层面。因果实验:合成一组受控分子对(环数递增、其他描述符匹配),测量各架构的误差随环数的增长曲线,并与感受野(层数 L)做交叉。可检验假设:若失效源于感受野不足,则加深至 5–6 层配合虚拟节点或全局注意力应选择性地修复大分子误差而不影响小分子。

6.3 新兴方向

⑧ 架构选择的自动化。本文主张「层类型应作为超参」,但它自己是手工扫的四个点。下一步:把 AGG/UPD 函数族作为搜索空间做可微 NAS,并与「扫四种标准层」这个便宜基线做同等算力预算下的 head-to-head 对比明确的空白:目前无人知道,在分子回归上,一个学出来的聚合函数是否真的优于从四个已知选项中选最好的那个。这个对比实验的缺失,正是判断「NAS 值不值」的关键证据缺口。

⑨ 跨色谱/跨测定条件的迁移基准。本文偶然证明了反相色谱 → HILIC 的跨模式迁移有效(GIN 改善 17.0%)。值得做成正式基准:多种色谱模式、多种测定协议之间的迁移矩阵,量化「域距离 × 迁移收益」的关系。在代谢组学结构注释中有直接应用价值。

⑩ 基准论文的可复现性契约。§2.7 第 ⑧ 条揭示的问题不是本文独有。具体机制提议:arXiv 的基准类论文应支持「仓库可达性」的自动化持续检查,并在论文页面展示最近一次检查的时间戳与状态。这不是技术难题,是流程空白。

最关键的单个空白。如果只能做一个实验,应该是 §6.1 第 ③ 条的池化析因实验。理由:成本最低(10–40 组);它修复的混淆污染了本文最重要的结论(30% 的迁移跨度到底是 GIN 的功劳还是 sum 池化的功劳);它的结论会立即影响所有把 GIN 作为底座的后续工作。在这个实验做完之前,「GIN 是最佳迁移架构」这个论断严格来说应当写作「GIN + sum 池化 是最佳迁移配置」。

7 · 其他值得关注的近期工作

本期候选池中未被抽中但同样值得跟进的 AI4Science 工作。

LeMat-GenBench: A Unified Evaluation Framework for Crystal Generative Models(2025.12,v2 2026.01)

与本文精神高度一致的材料领域版本:晶体生成模型的评测同样碎片化,各家用各家的稳定性/新颖性/唯一性定义。若你关心「评测协议审计」这条线,这篇与 MolGraphBench 应当对读。
arXiv

NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents(2025.10)

把「科学定律发现」从符号回归的玩具设定推进到需要泛化的设定。值得看的原因:它直面了 LLM 智能体评测中最难的问题——如何区分「记住了定律」与「发现了定律」。
arXiv · HTML

Six Open Questions in Machine-Learned Interatomic Potential Foundation Models(2026.06)

MLIP 基础模型领域的立场论文,与 Bechler-Speicher 的图学习 position 论文属同一体裁。适合快速建立该子领域的问题地图。
arXiv · HTML

Can LLM Design High-Quality Experiments? (OptED)(2026.08)

本期候选池中最新的一篇。自主实验设计是 AI4Science 中最接近「闭环科学」的环节,而这方面的严肃基准极少。
arXiv · HTML

Agentic Self-Driving Microscopy Benchmarks Support Qualification but Do Not Necessarily Generalize to Unseen Tasks(2026.08)

标题本身就是结论,而且是一个负面结论——这类诚实的负面基准结果在 agent 领域太稀缺了。与 OptED 配合阅读效果最佳。
arXiv · HTML

Open Materials Generation with Inference-Time Reinforcement Learning (OMatG)(2026.02,v2 2026.06)

把推理期 RL 引入晶体生成。若你在追踪 test-time scaling 从 LLM 向科学生成模型的外溢,这是一个清晰的样本。
arXiv · HTML

PoET-2: Understanding protein function with a multimodal retrieval-augmented foundation model(2025.08,NeurIPS 2025 poster)

检索增强 + 多模态在蛋白质语言模型上的落地。本期唯一进入候选池的 NeurIPS 主会级蛋白质工作。
arXiv

8 · 结论:这篇论文该怎么读

如果你只有五分钟:读 Table 4。四种 GNN 层类型在完全相同的迁移流水线下,MAE 从 75.621 跨到 52.914——30.0% 的性能差距,全部来自换一个卷积层。这个数字应该改变你下次搭建分子性质预测流水线时的第一步。

如果你要引用它:引用 Table 4 和它的迁移学习结论。不要引用摘要中「三个数据集上优于或相当于 SOTA」的说法(真实战绩是 1 胜 1 平 2 负 + 1 项 SOTA 基线数值自相矛盾),也不要引用「指纹非互补」的结论(论文自己的数据显示融合在 20 个单元中的 10 个有效,且严格按数据域分层)。

如果你要在此基础上做研究:先做池化析因实验(§6.1③)。在把 sum 池化与 GIN 拆开之前,本文最重要的结论是不可归因的。

这篇论文的真正贡献不在它的结论,而在它的问题。分子图学习领域用了五年时间把「底层层类型」当成一个不需要讨论的背景常量,而这个常量可能值 30% 的性能。提出这个问题所需的洞见,远大于回答它所需的实验——而本文的执行恰恰在实验严谨性上没有配得上它的问题意识。这既是它的局限,也是它留给社区最清晰的行动项。

附录 · 本报告的派生计算说明

以下数值均非论文原文报告,由本人从 Table 2/3/4 的原始数值重新计算:

派生量计算方法出现位置
跨数据集平均排名对每个数据集内 12 个方法按 RMSE 升序排名,跨 5 数据集取算术均值§2.5.2
与 SOTA 的相对差距(本文最优 − SOTA) / SOTA × 100%§2.5.2、§2.7①
指纹融合增益矩阵(GNN-FP − GNN) / GNN × 100%,20 个单元§2.5.3、图 1
架构相对跨度(max − min) / max × 100%,仅取 4 个纯 GNN§2.5.4、图 2
显著性检验双样本 t 检验,t = (x̄₂−x̄₁)/(s_p·√(2/n)),s_p = √((s₁²+s₂²)/2),n=3,df=4,t_crit,0.05 = 2.78§2.5.5
头→完全微调改善(仅头 − 完全) / 仅头 × 100%§2.5.4、图 3
已知的计算局限。t 检验假设三次重复相互独立且方差齐性。如 §2.5.5 所述,三次重复共享同一数据划分,因此独立性假设在严格意义上不成立,计算出的 t 值应视为乐观上界——真实的不确定性只会更大。因此「4/5 数据集不显著」这一结论是稳健的:若考虑划分方差,不显著的数据集只会更多,不会更少。