ML/AI 每日深度追踪 · 周日 · AI4Science 与跨界
MolGraphBench: A Benchmark of GNN Architectures for Molecular Regression Tasks
分子图学习领域用了五年时间,把「底层卷积层类型」当成一个不需要讨论的背景常量。本文的数据说明这个常量在迁移学习场景下值 30.0% 的性能——比一篇 Nature 子刊论文的全部创新高出约四倍。但本文自身在 5 个数据集中的 4 个上,其宣称的「最优架构」不具统计显著性。
在进入正文前,先把本期报告的三个已知局限摆在明面上:
ml-report-index.md 无法读取,14 天去重检查未能执行,索引也未能自动追加本期记录。shuf -i 1-27 -n 1 抽中索引 6 = MolGraphBench。重抽次数:0。资料充分性检查通过。所有链接均经实际访问验证。「未找到」= 多轮检索后仍无法定位;「403」= 页面确实存在但抓取被反爬拦截,标题与卷期经镜像交叉确认。
| 论文 | 会议 / 期刊页 | arXiv | Code | 数据集 |
|---|---|---|---|---|
| MolGraphBench | 无(arXiv 预印本,未见会议收录) | 2602.20573v3 cs.LG · 2026-06-18 |
⚠ 未找到 正文声明 rajanbit/MolGraphBench |
MoleculeNet · B3DB · GNN-TL(RT) |
| 论文 | 会议 / 期刊页 | arXiv | Code |
|---|---|---|---|
| MPNN · Gilmer et al., ICML 2017 | PMLR v70 | 1704.01212 | 未找到 |
| MoleculeNet · Wu et al., Chem. Sci. 2018 | RSC DOI · 开放全文 | 1703.00564 | deepchem · moleculenet |
| FP-GNN · Cai et al., Brief. Bioinform. 2022 | OUP DOI | 2205.03834 | idrugLab/FP-GNN(二手引用) |
| GNN-TL · Yang et al., J. Chromatogr. A 2021 | ScienceDirect(403,镜像确认) | 未找到(无预印本) | Qiong-Yang/GNN-TL |
| Position: Poor Benchmarks · Bechler-Speicher et al. | ICML 2025 Position Track | 2502.14546 | 不适用 |
| MolGraph-xLSTM · Sun et al., Commun. Chem. 2025 | Nature DOI | 2501.18439 | syan1992/MolGraph-xLSTM(二手引用) |
| CKA 分子嵌入 · Welsch et al., JCIM 2024 | ACS DOI | 无(ChemRxiv) | 未找到 |
| GCN · Kipf & Welling, ICLR 2017 | — | 1609.02907 | — |
| GraphSAGE · Hamilton et al., NeurIPS 2017 | — | 1706.02216 | — |
| GAT · Veličković et al., ICLR 2018 | — | 1710.10903 | — |
| GIN · Xu et al., ICLR 2019 | — | 1810.00826 | powerful-gnns |
注:在抓取到的 v3 参考文献列表中,未出现 Xu et al. (2019) 的 GIN 原始论文条目,而 Kipf&Welling、Hamilton、Veličković 三篇均在列。这可能是 HTML 抽取不完整所致,也可能是真实的引用遗漏。无法确认是哪一种,故仅作提示,不计入批评条目。
后半句是本报告的派生结论。论文自己只说到前半句,并未意识到该效应是分场景的。这个「分场景」正是本文最有价值却被作者自己错过的发现(见 §2.5.4 相变分析)。
论文的问题陈述在字面上很朴素:「尽管 GNN 在分子性质预测上应用激增,一个严谨的基准仍然缺失。」但这句话背后有一个更具体、可验证的观察。论文 Table 1 梳理了近年提出的「新」GNN 架构,并按其底层层类型分类:
| 底层层类型 | 建立于其上的近期工作 |
|---|---|
| GCN | GNN-TL、MvMRL、MolGraph-xLSTM、GraphB3 |
| GAT | FP-GNN、AttentiveFP、TChemGNN |
| GAT + 其他 | KA-GNNs(GAT+GCN 或 GAT+GIN)、DGCL(双图,GAT+GIN) |
| MPNN 变体 | D-MPNN、FH-GNN、GMC-MPNN |
| Graph Transformer | CLAPS |
这张表暴露的问题是:这些工作各自选定一种底层层类型,然后在其上堆叠创新(xLSTM、MoE、对比学习、KAN、指纹融合),并把最终性能提升全部归因于自己的创新模块。但没有任何一篇做过「如果只换底层层类型会怎样」的对照实验。整个子领域的增量声明,都建立在一个未经检验的假设上:底层层类型的影响很小,可视为背景常量。
在完全相同的迁移学习流水线下(相同预训练语料 METLIN、相同微调协议、相同数据集 RT、相同 MLP 头),只改变卷积层类型:
| 层类型 | 完全微调 MAE | 相对最差者 |
|---|---|---|
| GCN | 75.621 ± 3.456 | — |
| GAT | 72.195 ± 1.112 | −4.5% |
| GraphSAGE | 70.752 ± 2.750 | −6.4% |
| GIN | 52.914 ± 1.218 | −30.0% |
论文的论证不是线性的「提方法—做实验—报结果」,而是一个四判据收敛结构:
设分子 SMILES 经 RDKit 解析得图 G=(V,E),节点为原子、边为化学键,节点特征 X ∈ R^{N×118}(元素周期表 one-hot)。完整流水线:
| 层 | AGG | UPD | 关键性质 |
|---|---|---|---|
| GCN | 度归一化均值 Σ h_u/√(d_v d_u) | 线性 + 非线性 | 各向同性、谱域动机 |
| GAT | 注意力加权和 Σ α_vu·h_u | 线性 + 非线性 | 邻居自适应加权 |
| GraphSAGE | 均值后与自身拼接 | W · [h_v ‖ AGG] | 自身与邻居分离编码 |
| GIN | 求和 Σ h_u | MLP((1+ε)h_v + AGG) | 单射,达 1-WL 表达上界 |
| 机制 / 维度 | 设计选择 | 动机 | 关键超参 |
|---|---|---|---|
| 节点特征 | 118 维元素 one-hot | 最小化手工特征工程 | dim = 118 |
| 图卷积深度 | 2–3 层 | 避免过平滑 | L ∈ {2,3}(具体值未公开) |
| 归一化 | GraphNorm | 图级批统计,适配变长图 | — |
| 残差连接 | 每层后 | 缓解深层退化 | — |
| 读出(池化) | 全局均值;GIN 用求和 | 均值对图大小不变;求和保留 GIN 单射性 | ⚠ 与层类型混淆 |
| 指纹分支 | ECFP4 1024-bit → FC | 引入拓扑先验 | radius=2, nbits=1024 |
| 融合方式 | 拼接 concat(G, F) | 最简单的融合 | ⚠ 未做消融 |
| 优化 | Adam + MSE,100 epoch,早停 patience=10 | — | lr 未公开 |
| 划分 | 随机 80/10/10 | 与 MoleculeNet 推荐一致 | ⚠ 划分固定,非交叉验证 |
| 重复 | n = 3 | 报告 mean ± SD | ⚠ 见 §2.5.5 |
五个数据集,覆盖三个应用域,规模跨度 6.5 倍:
| 数据集 | 分子数 | 测试集(10%) | 域 | 预测目标 |
|---|---|---|---|---|
| ESOL | 1,028 | ~103 | 物理化学 | 水溶性 log S |
| FreeSolv | 642 | ~64 | 物理化学 | 水合自由能 |
| Lipophilicity | 4,200 | ~420 | 物理化学 | logD |
| B3DB | 1,058 | ~106 | 生物 | 血脑屏障通透性 logBB |
| RT | 1,400 | ~140 | 分析化学 | HILIC 保留时间 |
数据集选择有一处值得称道的设计:跨越三个性质截然不同的域。ESOL/FreeSolv/Lipophilicity 是「局部可加」性质(大体可由片段贡献叠加),B3DB 是「全局药效团依赖」性质,RT 是「色谱相互作用」性质。这个跨域设计使得 §2.5.3 的发现成为可能——尽管论文自己没有利用它。
| 方法 | B3DB | ESOL | FreeSolv | Lipophilicity | RT |
|---|---|---|---|---|---|
| LR | 1.426 (0.000) | 4.380 (0.000) | 2.116 (0.000) | 1.011 (0.000) | 601.600 (0.000) |
| SVM | 0.471 (0.000) | 1.128 (0.000) | 1.512 (0.000) | 0.730 (0.000) | 120.555 (0.000) |
| RF | 0.550 (0.002) | 1.569 (0.009) | 2.572 (0.015) | 0.950 (0.001) | 103.548 (0.456) |
| XGB | 0.580 (0.001) | 1.615 (0.003) | 2.420 (0.006) | 1.057 (0.001) | 108.227 (0.387) |
| GCN | 0.518 (0.007) | 0.808 (0.030) | 1.288 (0.104) | 0.664 (0.010) | 96.170 (2.743) |
| GAT | 0.552 (0.011) | 0.808 (0.081) | 1.736 (0.061) | 0.639 (0.028) | 94.734 (4.295) |
| GIN | 0.555 (0.011) | 0.772 (0.044) | 1.461 (0.176) | 0.672 (0.020) | 92.344 (3.042) |
| GraphSAGE | 0.542 (0.011) | 0.762 (0.041) | 1.352 (0.071) | 0.629 (0.006) | 89.477 (1.067) |
| GCN-FP | 0.508 (0.007) | 1.000 (0.030) | 1.346 (0.064) | 0.794 (0.017) | 94.879 (1.925) |
| GAT-FP | 0.525 (0.014) | 0.979 (0.078) | 1.355 (0.081) | 0.682 (0.016) | 88.417 (1.662) |
| GIN-FP | 0.549 (0.020) | 0.814 (0.015) | 1.022 (0.067) | 0.699 (0.011) | 91.739 (0.908) |
| GraphSAGE-FP | 0.529 (0.011) | 0.969 (0.012) | 1.247 (0.064) | 0.724 (0.013) | 89.927 (1.361) |
| SOTA(外部) | 0.56 | 0.53 | 1.02 | 0.55 | MAE 70.40 ⚠ |
SOTA 归属:B3DB ← GMC-MPNN (Nguyen 2026);ESOL/FreeSolv/Lipophilicity ← MolGraph-xLSTM (Sun 2025);RT ← GNN-TL (Yang 2021)。RT 的 SOTA 值存在严重问题,见 §2.7 第 ① 条。
| # | 方法 | 平均排名 | 各数据集排名 (B3DB/ESOL/FreeSolv/Lipo/RT) |
|---|---|---|---|
| 1 | GraphSAGE | 3.00 | 6 / 1 / 5 / 1 / 2 |
| 2 | GCN | 4.00 | 3 / 3 / 3 / 3 / 8 |
| 3 | GAT-FP | 4.60 | 4 / 7 / 6 / 5 / 1 |
| 3 | GIN-FP | 4.60 | 7 / 5 / 1 / 6 / 4 |
| 3 | GraphSAGE-FP | 4.60 | 5 / 6 / 2 / 7 / 3 |
| 6 | GIN | 5.60 | 10 / 2 / 7 / 4 / 5 |
| 7 | GAT | 6.00 | 9 / 4 / 9 / 2 / 6 |
| 7 | GCN-FP | 6.00 | 2 / 8 / 4 / 9 / 7 |
| 9 | SVM | 7.40 | 1 / 9 / 8 / 8 / 11 |
| 10 | RF | 9.80 | 8 / 10 / 12 / 10 / 9 |
| 11 | XGB | 11.00 | 11 / 11 / 11 / 12 / 10 |
| 12 | LR | 11.40 | 12 / 12 / 10 / 11 / 12 |
论文摘要称「我们的 GNN 模型在三个数据集上取得优于或相当于当前 SOTA 的性能」。这句话字面成立,但它省略的部分更重要:
| 数据集 | 本文最优 | 数值 | 声称 SOTA | 差距 | 判定 |
|---|---|---|---|---|---|
| B3DB | GCN-FP | 0.508 | 0.56 | −9.3% | ✅ 优于 |
| FreeSolv | GIN-FP | 1.022 | 1.02 | +0.2% | ⚖ 持平 |
| ESOL | GraphSAGE | 0.762 | 0.53 | +43.8% | ❌ 显著劣于 |
| Lipophilicity | GraphSAGE | 0.629 | 0.55 | +14.4% | ❌ 劣于 |
| RT | GIN (MAE) | 63.783 | MAE 70.40 | −9.4% ⚠ | ⚠ SOTA 值本身有误 |
图 1 · 指纹融合增益按数据集完美分层(论文未做的派生矩阵)
各数据集上 4 个架构的 (GNN-FP − GNN)/GNN 均值。负值 = 指纹带来改善。数据源:Table 2,20 个架构-数据集配对单元。
论文的结论是:「指纹与图嵌入本质上是非互补的,除 FreeSolv 外未见性能增益。」我把 Table 2 中 4 架构 × 5 数据集 = 20 个配对单元的融合增益全部算出(负值 = 改善):
| 架构 | B3DB | ESOL | FreeSolv | Lipophilicity | RT |
|---|---|---|---|---|---|
| GCN | −1.93% | +23.76% | +4.50% | +19.58% | −1.34% |
| GAT | −4.89% | +21.16% | −21.95% | +6.73% | −6.67% |
| GIN | −1.08% | +5.44% | −30.05% | +4.02% | −0.66% |
| GraphSAGE | −2.40% | +27.17% | −7.77% | +15.10% | +0.50% |
| 列均值 | −2.58% | +19.38% | −13.81% | +11.36% | −2.04% |
| 有效比例 | 4/4 | 0/4 | 3/4 | 0/4 | 3/4 |
可检验的假设:ECFP4 编码的是子结构存在性(药效团式信息)。当目标性质依赖全局药效团特征(血脑屏障通透性、色谱相互作用)或训练数据极少时,它提供了 GNN 从小数据学不到的先验;当目标性质是局部可加的物理化学量(溶解度、logD)时,GNN 的消息传递本就能高效学到,此时 1024 维稀疏指纹只是引入噪声与过拟合风险。
论文把这个有结构、有解释力的现象压缩成了一句「非互补」。这是全文信息损失最严重的一处。
图 2 · ⚡ 相变现象:架构选择的效应量是场景依赖的
纵轴为「最优架构 vs 最差架构」的相对性能跨度 (max−min)/max。前五项为从头训练(Table 2),末项为迁移学习完全微调(Table 4,同为 RT 数据集)。
预训练:METLIN(80k SMILES,反相色谱 RT)。微调:RT 数据集(1,400 条,HILIC)。三级微调粒度:
| 层类型 | 仅回归头 | FC 投影 + 回归头 | 完全微调 | 头→完全 改善 |
|---|---|---|---|---|
| GCN | 93.725 (1.716) | 82.737 (1.119) | 75.621 (3.456) | −19.3% |
| GAT | 91.323 (5.436) | 83.671 (3.974) | 72.195 (1.112) | −20.9% |
| GraphSAGE | 84.543 (1.924) | 75.237 (0.264) | 70.752 (2.750) | −16.3% |
| GIN | 60.960 (0.158) | 55.011 (0.474) | 52.914 (1.218) | −13.2% |
GIN 为何在迁移下胜出?论文未作解释。一个与 Xu et al. (2019) 理论一致的假设是:GIN 的求和聚合是单射的,达 1-WL 表达上界,能保留最丰富的结构信息。这种表达能力在小数据从头训练时是负担(易过拟合,故 GIN 在 B3DB 上排名第 10),但在 80k 分子上预训练时可被充分利用。这个假设可用一个便宜的实验证伪:在 METLIN 预训练规模上做 10k/40k/80k 缩放曲线,看 GIN 的相对优势是否随预训练规模单调扩大。
图 3 · 三级微调粒度下的四种架构,以及 RT 基线数值的自相矛盾
纵轴 MAE(越低越好)。两条虚线分别是论文 Table 2 记录的 SOTA(70.40)与论文正文所述的同一基线(38.6)——同一篇论文对同一基线给出了相差 82% 的两个数字。
论文报告了 n=3 的标准差,但从未做过任何显著性检验,却在正文中反复使用「最优架构」的表述。双样本 t 检验(df=4,α=0.05,tcrit=2.78),检验每个数据集上「最优 vs 次优」架构的差距:
| 数据集 | 最优 | 次优 | 差距 | t 统计量 | 判定 |
|---|---|---|---|---|---|
| B3DB | GCN 0.518±0.007 | GraphSAGE 0.542±0.011 | 0.024 | 3.19 | ✅ 显著 |
| ESOL | GraphSAGE 0.762±0.041 | GIN 0.772±0.044 | 0.010 | 0.29 | ❌ 不显著 |
| FreeSolv | GCN 1.288±0.104 | GraphSAGE 1.352±0.071 | 0.064 | 0.88 | ❌ 不显著 |
| Lipophilicity | GraphSAGE 0.629±0.006 | GAT 0.639±0.028 | 0.010 | 0.60 | ❌ 不显著 |
| RT | GraphSAGE 89.477±1.067 | GIN 92.344±3.042 | 2.867 | 1.54 | ❌ 不显著 |
迁移学习结果不受此影响:GIN 52.914±1.218 vs GraphSAGE 70.752±2.750,差距 17.8 是合并标准差的 8 倍以上。这再次说明:论文真正稳固的发现在迁移部分,而摘要的重心却放在了不稳固的从头训练部分。
| 方法 | B3DB | ESOL | FreeSolv | Lipophilicity | RT |
|---|---|---|---|---|---|
| LR | 50.943 | 83.186 | 67.692 | 54.762 | 80.714 |
| SVM | 18.868 | 53.982 | 41.538 | 36.905 | 48.571 |
| RF | 30.503 | 77.581 | 75.897 | 52.381 | 60.714 |
| XGB | 33.648 | 77.876 | 69.231 | 60.159 | 68.095 |
| GCN | 25.472 | 42.478 | 32.308 | 37.381 | 36.905 |
| GAT | 25.157 | 46.018 | 38.974 | 38.095 | 40.476 |
| GIN | 27.673 | 37.463 | 38.462 | 37.381 | 32.381 |
| GraphSAGE | 30.818 | 40.708 | 50.769 | 35.714 | 40.238 |
不是「做了一次 GNN 基准测试」——这类基准每年都有。是:把「底层层类型」这个变量从背景常量提升为可测量的实验对象,并(在迁移学习子场景里)给出了它值 30% 性能的证据。这个证据的力量在于它是在完全受控的条件下取得的——同一数据、同一预训练语料、同一微调协议、同一回归头,只换一个 AGG/UPD 函数。
① [论证缺口 / 事实错误] RT 数据集的 SOTA 基线数值与论文自身正文相互矛盾,导致该数据集的所有比较结论失效。
论文 Table 2 将 RT 的 SOTA 列为 MAE = 70.40,归属于 GNN-TL (Yang et al., 2021)。但论文正文另有一句原文:
同一篇论文的表格与正文,对同一个基线给出了 70.40 和 38.6 两个相差 82% 的数字。采用哪个数字,会完全颠覆结论:
| 本文结果 | vs Table 2 的 70.40 | vs 正文的 38.6 |
|---|---|---|
| GIN 从头训练 MAE 63.783 | −9.4%(胜) | +65.2%(惨败) |
| GIN 完全微调 MAE 52.914 | −24.8%(大胜) | +37.1%(负) |
| GraphSAGE 完全微调 70.752 | +0.5%(持平) | +83.3%(惨败) |
| GCN 完全微调 75.621 | +7.4%(负) | +95.9%(惨败) |
摘要中「GIN with MAE of 63.783 on RT datasets」作为三项超越 SOTA 的成就之一被列出——若正文的 38.6 是正确值,这项成就实为落后 65.2%。
② [统计有效性] 4/5 数据集上宣称的「最优架构」不具统计显著性,且方差估计本身系统性偏低。
§2.5.5 已详述:只有 B3DB 一个数据集的最优 vs 次优差距显著(t=3.19 > 2.78),其余 4 个 t 值在 0.29–1.54 之间。而摘要断言「GCN 和 GIN 是最优 GNN 架构」。更深一层:LR/SVM 的 SD 恰为 0.000,证明三次重复共享同一划分,因此报告的 SD 只反映初始化方差、不含划分方差。这意味着连那唯一「显著」的 B3DB 结果也建立在被低估的不确定性之上。
③ [论证缺口] 核心结论「指纹非互补」被本文自己的数据证伪,且错失了一个有解释力的发现。
§2.5.3 已详述:融合在 20 个单元中的 10 个带来改善(50%),且改善与否按数据集完美分层——B3DB 4/4、RT 3/4、FreeSolv 3/4 有效;ESOL 0/4、Lipophilicity 0/4。论文将这个有结构的现象概括为「非互补,除 FreeSolv 外无增益」,既不准确(漏掉 B3DB 与 RT 的一致增益),也丢失了「指纹在生物/分析化学终点上有效、在物理化学终点上有害」这个可解释、可预测的规律。
④ [论证缺口] 「CKA 低但融合无效」的矛盾被标记为「反直觉」后即被搁置,而它恰恰指向可检验的机制假设。
至少有三个可检验的解释,本文一个都没有测试:
⑤ [实验设计混淆] GIN 使用求和池化而其余三者使用均值池化,使「架构效应」与「池化效应」完全无法分离。
论文自己承认了这个混淆——在解释「GIN 与其他架构 CKA 低」时写道:「可能是由于池化公式的差异(GIN 用 add 池化,其他 GNN 用 mean 池化)。」但这个混淆污染的不只是 CKA 分析,而是全文所有涉及 GIN 的结论,包括最重要的迁移学习结果。GIN 52.914 vs GCN 75.621 这个 30% 的差距,无法判断有多少来自单射聚合、多少来自求和池化——而求和池化保留了图规模信息,RT 保留时间恰恰与分子大小强相关,这是一个高度合理的替代解释。修复成本极低:跑 GIN+mean 与 GCN+add 两个对照,2×5 = 10 组额外实验。这是全文最该做而未做的消融。
⑥ [术语误用] 将「仅微调回归头」称为 zero-shot learning。
论文原文:「Even with zero-shot learning (fine-tuning MLP regression head), MAE of 60.960 was achieved.」微调一个回归头需要在目标数据上做梯度更新,这是标准的 linear probing(线性探针),不是 zero-shot。这个误用会让引用本文的后续工作产生错误的性能预期——真正的 zero-shot 数值(直接用 METLIN 预训练模型在 HILIC 上推理)论文根本没有报告,而那个数字才是回答「表示能否跨色谱模式直接迁移」的关键。
⑦ [覆盖缺口] 四判据之一的「预测质量」从未在 GNN-FP 模型上评估。
Table 3 只有 8 行(4 ML + 4 纯 GNN),缺失全部 4 个 GNN-FP 变体。而「指纹非互补」是贯穿全文的结论之一。在药物发现中,避免灾难性预测往往比平均精度更有价值——这 4 行数据的计算成本为零,却缺失了。
⑧ [可复现性风险] 声明的代码仓库无法定位,且论文标题在版本间发生变更。
v3 正文声明数据与代码可在 github.com/rajanbit/MolGraphBench 获取。经多种检索策略(仓库名精确匹配、站内检索、作者名关联检索)均未能定位该仓库,而同一作者的其他仓库可正常检索到。同时 v2 正文写的是「可向作者合理索取」,并无仓库。叠加标题变更,判断是该仓库很可能尚未公开或已失效。结合超参搜索空间、逐数据集最优超参、F_embed 维度、训练时间四项关键信息全部只存在于代码/补充材料中,本文目前实质上是不可复现的。
沿本文的引用脉络与问题继承关系,选取 5 篇构成一条完整的问题传递链。这不是五个平行的工作总结,而是一条「分子图学习如何一步步把『架构选择』这个变量丢失、又如何被重新捡起」的历史。
解决了什么问题。在 MPNN 之前,分子图上的神经网络是一堆彼此孤立的方法:Duvenaud 的神经指纹、Kearnes 的图卷积、Li 的 GGNN 各说各话,无法比较。Gilmer 等人的贡献是提出统一抽象——所有这些方法都可以写成「消息函数 M + 更新函数 U + 读出函数 R」的三段式。核心贡献一句话:把分子图神经网络从一堆技巧统一成一个有明确设计维度的架构族。最佳集成模型在 QM9 全部 13 个目标上取得当时 SOTA,其中 11/13 达到化学精度。
遗留了什么缺口。MPNN 定义了设计空间,却没有给出在这个空间里如何选点的任何指导。论文探索了若干 M/U/R 变体,但只在 QM9 单一数据集(且是高度理想化的小有机分子量子化学数据)上。留下的空白是:当任务从 QM9 换成实验测量的溶解度、通透性、保留时间时,设计空间里的最优点会不会移动?MPNN 从未回答,后续十年也几乎没人系统地问过。
核心论文的回应。MolGraphBench 直接在这个空白上工作。它固定了 MPNN 框架中除 M/U 之外的一切(同样的 118 维原子特征、同样的 FC 投影、同样的 GraphNorm+残差、同样的 2 层 MLP 头),只让 M/U 在四个已知实例间变化,然后在五个实验测量数据集上测量这个变化的效应量。这正是 MPNN 论文应该做但没做的那个实验。
关键设计的传递。MPNN 的三段式抽象在本文中原封不动地成为实验的控制骨架——正是因为 M/U/R 可分离,「只换层类型、其余全同」这个受控实验才在工程上可行。但传递中丢了一样东西:MPNN 把 R(读出)也当作设计维度,而本文把 R 固定为均值池化——唯独 GIN 例外用了求和。这个不彻底的固定,正是 §2.7 第 ⑤ 条混淆的根源。
解决了什么问题。2018 年前,分子机器学习论文各用各的数据、各划各的训练测试集,横向比较不可能。MoleculeNet 提供 17 个数据集、逾 70 万化合物、逾 800 个任务的统一集合,配套 DeepChem 实现和推荐划分。本文使用的 ESOL(1,128)、FreeSolv(643)、Lipophilicity(4,200)均出自此。核心贡献一句话:给分子机器学习装上了共同的度量衡。
遗留了什么缺口。MoleculeNet 统一了数据,却在无意中固化了一种评测文化:一篇论文的价值 = 它在这几张表上把 RMSE 降低了多少。架构、超参、划分这些维度被压缩进「我们的方法」这个黑盒里,只有最终数字被拿出来比较。这直接导致了本文 Table 1 所描述的局面——十余种「新架构」各自宣称提升,却无人知道提升来自哪个组件。
核心论文的回应。MolGraphBench 继承 MoleculeNet 的数据与划分,但把评测的因变量换了:不再问「哪个方法 RMSE 最低」,而问「在方法固定的前提下,某个特定设计维度值多少」。同时把数据集从三个物理化学数据集扩展到 B3DB(生物)和 RT(分析化学)——正是这个扩展让 §2.5.3 的域依赖性发现成为可能。
关键设计的传递。从「benchmark = 一组数据集」进化为「benchmark = 一个受控实验设计」。MoleculeNet 的贡献是横轴(数据集),MolGraphBench 试图补上纵轴(受控的架构变量)。
解决了什么问题。图表示与分子指纹各有所长:GNN 学到任务相关的连续表示,指纹编码专家设计的子结构先验。FP-GNN 提出双通道架构——GAT 分支处理分子图,ANN 分支处理三种互补指纹(MACCS + PubChem + Pharmacophore ErG),在全连接层融合。核心贡献一句话:证明图与指纹可以互补,融合优于任一单独通道。在 13 个基准的 16 个任务中于 7 个取得最佳;LIT-PCBA 平均 AUC 0.739;14 个乳腺癌细胞系数据集平均 AUC 0.849,优于 AttentiveFP、GAT、GCN、MPNN 与 XGBoost。
遗留了什么缺口。FP-GNN 证明了「融合有效」,却没有拆解为什么有效、何时有效。它同时改变了三件事(引入指纹分支、用三种指纹、用 GAT 底层),因此增益无法归因。更关键的是:它从未测试「指纹数量」这个维度——单指纹够不够?也从未测试跨域一致性。
核心论文的回应。MolGraphBench 的 GNN-FP 变体是对 FP-GNN 范式的一次受控复检:把融合从 GAT 一个底层推广到全部四个底层,跨五个数据集测量增益。这是 FP-GNN 未做的归因实验。但这次复检的结论「融合无效」并不成立——因为本文只用了单一 ECFP4(1024-bit),而 FP-GNN 的核心主张恰恰建立在三种互补指纹上。本文误把一个更弱命题的证否,当成了对更强命题的反驳。
关键设计的传递。融合位置的传递是完整的:FP-GNN 在全连接层合并,本文在池化后拼接再进 2 层 MLP——本质相同。丢失的是指纹的多样性维度。而本报告 §2.5.3 的域依赖性发现,恰好为 FP-GNN 的路线提供了新的辩护:指纹在 B3DB(生物)上 4/4 有效,正是 FP-GNN 所专注的生物活性任务类型。
解决了什么问题。HILIC 色谱保留时间预测的困境是实验标注极其昂贵,公开数据只有千条量级。GNN-TL 的方案是先在 ~306K 条 in-silico(伪标签)HILIC 保留时间数据上预训练 GNN,再在小规模真实 HILIC 数据上微调。核心贡献一句话:用大规模同域伪标签数据的预训练,突破小样本色谱预测的数据瓶颈。本文使用的 RT 数据集(1,400 分子)及其配套仓库即出自此工作。
遗留了什么缺口。GNN-TL 只用了一种架构。因此它证明的是「迁移学习对这个任务有效」,但迁移增益中有多少属于『预训练』、多少属于『恰好选对了架构』,完全无法分离。此外它的预训练语料是同域 in-silico HILIC——留下另一个问题:如果只有异域数据(如反相色谱),迁移还成立吗?
核心论文的回应。MolGraphBench 的 Table 4 同时回答了这两个问题,而且回答得比论文自己意识到的更有力:
关键设计的传递与断裂。三级微调粒度协议是本文相对 GNN-TL 的方法学改进。但传递中发生了一次严重的记账错误:本文把 GNN-TL 的基线数值在 Table 2 中记为 MAE 70.40,而在正文中又写 38.6(§2.7 第 ① 条)。由于 GNN-TL 用的是同域 306K 预训练、本文用的是异域 80K 预训练,两者本就不应直接对比;把它列为可比 SOTA 并宣称超越,是这条继承链上最不严谨的一环。
解决了什么问题。这不是一篇方法论文,而是一篇诊断。Bechler-Speicher 等 12 位作者(含 Bronstein、Morris、Perozzi、Galkin)主张:图机器学习正因基准设计不佳而流失领域相关性。具体指控包括——基准过度集中于分子图等狭窄领域而忽视组合优化、芯片设计等高影响场景;数据集代表性差;评测方式碎片化;过度强调单一准确率指标,导致模型过拟合基准而非获得可泛化能力。核心贡献一句话:把「基准质量」本身认定为图学习进步的瓶颈。提出三条方向:更有意义的基准、更严格的评测协议、加强与领域专家协作。
遗留了什么缺口。作为 position 论文,它诊断了病却没开出可执行的处方。「更严格的评测协议」具体意味着什么——多少次重复?哪种划分?是否需要显著性检验?如何控制混淆变量?这些都留给了社区。
核心论文的回应。MolGraphBench 在引言中引用了这篇立场论文,并可被理解为对其号召的一次具体响应:把「评测协议」从「报一个数」升级为「控制变量测效应量」,并把四个判据而非单一 RMSE 作为评价维度。
第一个转折在 2018:MoleculeNet 之后,评价从「我在自己的数据上有效」变成「我在共同的表上数字更低」。这是巨大的进步,代价是把多维的设计选择压缩成了一维的排行榜坐标。
第二个转折在 2025–2026,正在发生:从「优化排行榜位置」转向「审计排行榜有效性」。MolGraphBench、Bechler-Speicher 的 position 论文、以及同期涌现的一批评测框架(LeMat-GenBench、AtomBench、NewtonBench)共同构成这个转折。这个转折的特征是元级化——研究对象从模型变成了研究方法本身。
准确率(2017–2020)→ 数据效率与预训练(2020–2023)→ 可解释性与表示分析(2023–2025)→ 归因有效性与评测协议(2025– )
MolGraphBench 处在最后这个阶段的开端,它的不完善(统计不严、混淆未控、记账出错)恰恰是这个阶段早期的典型特征:问题意识已经到位,方法论纪律尚未跟上。
| 工作 | 年月 | 会议 / 出版 | 核心贡献 | 主要指标 | 与核心工作的关系 |
|---|---|---|---|---|---|
| MPNN | 2017.04 | ICML 2017(主会) | M/U/R 三段式统一框架 | QM9 13 目标全 SOTA;11/13 达化学精度 | 提供本文的受控实验骨架;本文补上其未做的「设计空间选点」实验 |
| GCN / GraphSAGE / GAT / GIN | 2017.02 / 2017.06 / 2017.10 / 2018.10 | ICLR'17 / NeurIPS'17 / ICLR'18 / ICLR'19 | 四种 AGG/UPD 实例 | 非分子领域基准 | 本文的四个被试对象;本文首次在分子回归上做受控对比 |
| MoleculeNet | 2018.01 | Chemical Science | 17 数据集 / 70万化合物统一基准 | ESOL 1,128 / FreeSolv 643 / Lipo 4,200;物化回归推荐随机划分 | 提供本文 3/5 数据集与划分协议;本文把因变量从「方法」换成「设计维度」 |
| GNN-TL | 2021.09 | J. Chromatogr. A | in-silico 预训练 + 微调破解 HILIC 小样本 | 306K 同域预训练;原文自报 MAE 38.6(本文 Table 2 记为 70.40 ⚠) | 提供本文 RT 数据集;本文将其单架构迁移推广至四架构,并揭示 30% 架构跨度 |
| FP-GNN | 2022.11 | Brief. Bioinform. | GAT + 三种互补指纹双通道融合 | 16 任务中 7 项最佳;LIT-PCBA AUC 0.739;细胞系 AUC 0.849 | 本文 GNN-FP 的直接前驱;本文用单一 ECFP4 得出的「非互补」结论不足以反驳其多指纹主张 |
| CKA 分子嵌入 | 2024.10 | JCIM 64:7303 | 把 CKA 引入化学信息学 | 提出适配非旋转不变模型的 CKA;caveat:结果依赖核函数选择 | 本文 CKA 分析的方法来源;本文用它得到 0.27–0.59 的读数,却未解决由此产生的矛盾 |
| Position: Poor Benchmarks | 2025.02 | ICML 2025 Position Track | 认定基准质量为图学习瓶颈 | 不适用(观点论文) | 本文的直接动机来源;本文是其号召的具体响应,但在统计严谨性上重蹈其所批评之覆辙 |
| MolGraph-xLSTM | 2025.09 | Commun. Chem. 8:286 | 原子级+基序级双层 xLSTM + 多头 MoE | ESOL 0.527±0.046、FreeSolv 1.024±0.076、Lipo 0.550±0.026;随机划分 8:1:1,n=3 | 本文 3 个数据集的 SOTA 基线;划分协议与本文一致,比较公平;本文最优模型在 ESOL 上落后其 43.8% |
| MolGraphBench | 2026.02 (v3: 2026.06) | arXiv 预印本 | 把层类型从背景常量提升为受控实验变量 | B3DB 0.508(−9.3%)· FreeSolv 1.022(持平)· ESOL 0.762(+43.8%)· Lipo 0.629(+14.4%)· 迁移 GIN MAE 52.914 | 汇聚点;四条演进线在此被统一到一个受控实验设计下 |
① 架构表达能力与迁移收益的定量关系。不是笼统的「研究表达能力」,而是:GIN 的 1-WL 表达上界与其迁移优势之间是否存在可测量的函数关系?具体实验:固定 RT 下游任务,在 METLIN 上以 {5k, 10k, 20k, 40k, 80k, 160k} 六个规模预训练四种架构,绘制「预训练规模 × 架构间性能跨度」曲线。可证伪的预测:若表达能力假设成立,GIN 的相对优势应随预训练规模单调扩大;若在某规模后平台化,说明优势来自别处(如求和池化保留的图规模信息)。高价值低门槛——所需算力约为本文全部实验的 1.5 倍。
② 条件互补性度量的构造。CKA 度量的是两个表示的边际差异,而融合收益取决于条件于标签的差异。需要一个新量:CI(A,B;y) = I(B;y | A) 的可估计代理——「在已知表示 A 的前提下,表示 B 还能提供多少关于 y 的信息」。路线:用 MINE 或 InfoNCE 估计条件互信息,在本文的 20 个单元上验证它能否预测 §2.5.3 的融合增益符号。如果能,这个度量将成为所有多模态分子模型的前置筛选工具。
③ 池化算子的独立效应。一个纯粹的 2×4 析因实验:{mean, sum} 池化 × {GCN, GAT, GIN, GraphSAGE},在五个数据集上跑。唯一目的是把 §2.7 第 ⑤ 条的混淆拆开。成本 10–40 组实验,收益是让本文(以及所有把 GIN 作为底座的工作)的结论变得可归因。
④ 域感知的指纹融合策略。§2.5.3 给出了可直接落地的规则草案:在生物终点(通透性、毒性、活性)与色谱/分析终点上启用指纹融合;在局部可加的物理化学终点(溶解度、logD、自由能)上禁用。验证实验:在 MoleculeNet 全部 17 个数据集上按域分层重跑 4 架构 × {纯, +FP},检验「域 → 融合有效性」映射是否稳定。若稳定,可固化为工程默认值。
⑤ 融合机制的消融。在固定 ECFP4 的前提下对比四种融合方式——朴素拼接(本文)、门控融合、交叉注意力、残差式(指纹分支只预测 GNN 的残差)。关键控制:F_embed 与 G_embed 维度必须严格配平。预期结果:若残差式融合在 ESOL 上把 +23.76% 的劣化翻转为改善,则证明问题出在融合方式而非互补性本身。
⑥ 评测协议的最小可接受标准。社区需要一个明确的清单,而非「更严格的协议」这种号召。草案:(a) 至少 5 折交叉验证 × 3 种子 = 15 次运行,报告划分方差与初始化方差的分解;(b) 任何「A 优于 B」的断言必须附检验统计量;(c) 所有 baseline 的超参搜索预算必须与自有方法相同并公开;(d) SOTA 引用必须注明其划分协议、预训练语料与指标定义。本文若满足 (a) 与 (b),其 4/5 数据集上的架构结论就不会被提出。
⑦ 大分子失效的机制定位。论文观察到「环数在 3/5 数据集上于高低误差组间显著不同」,但停在了相关性层面。因果实验:合成一组受控分子对(环数递增、其他描述符匹配),测量各架构的误差随环数的增长曲线,并与感受野(层数 L)做交叉。可检验假设:若失效源于感受野不足,则加深至 5–6 层配合虚拟节点或全局注意力应选择性地修复大分子误差而不影响小分子。
⑧ 架构选择的自动化。本文主张「层类型应作为超参」,但它自己是手工扫的四个点。下一步:把 AGG/UPD 函数族作为搜索空间做可微 NAS,并与「扫四种标准层」这个便宜基线做同等算力预算下的 head-to-head 对比。明确的空白:目前无人知道,在分子回归上,一个学出来的聚合函数是否真的优于从四个已知选项中选最好的那个。这个对比实验的缺失,正是判断「NAS 值不值」的关键证据缺口。
⑨ 跨色谱/跨测定条件的迁移基准。本文偶然证明了反相色谱 → HILIC 的跨模式迁移有效(GIN 改善 17.0%)。值得做成正式基准:多种色谱模式、多种测定协议之间的迁移矩阵,量化「域距离 × 迁移收益」的关系。在代谢组学结构注释中有直接应用价值。
⑩ 基准论文的可复现性契约。§2.7 第 ⑧ 条揭示的问题不是本文独有。具体机制提议:arXiv 的基准类论文应支持「仓库可达性」的自动化持续检查,并在论文页面展示最近一次检查的时间戳与状态。这不是技术难题,是流程空白。
本期候选池中未被抽中但同样值得跟进的 AI4Science 工作。
与本文精神高度一致的材料领域版本:晶体生成模型的评测同样碎片化,各家用各家的稳定性/新颖性/唯一性定义。若你关心「评测协议审计」这条线,这篇与 MolGraphBench 应当对读。
arXiv
把「科学定律发现」从符号回归的玩具设定推进到需要泛化的设定。值得看的原因:它直面了 LLM 智能体评测中最难的问题——如何区分「记住了定律」与「发现了定律」。
arXiv · HTML
MLIP 基础模型领域的立场论文,与 Bechler-Speicher 的图学习 position 论文属同一体裁。适合快速建立该子领域的问题地图。
arXiv · HTML
本期候选池中最新的一篇。自主实验设计是 AI4Science 中最接近「闭环科学」的环节,而这方面的严肃基准极少。
arXiv · HTML
标题本身就是结论,而且是一个负面结论——这类诚实的负面基准结果在 agent 领域太稀缺了。与 OptED 配合阅读效果最佳。
arXiv · HTML
把推理期 RL 引入晶体生成。若你在追踪 test-time scaling 从 LLM 向科学生成模型的外溢,这是一个清晰的样本。
arXiv · HTML
检索增强 + 多模态在蛋白质语言模型上的落地。本期唯一进入候选池的 NeurIPS 主会级蛋白质工作。
arXiv
如果你只有五分钟:读 Table 4。四种 GNN 层类型在完全相同的迁移流水线下,MAE 从 75.621 跨到 52.914——30.0% 的性能差距,全部来自换一个卷积层。这个数字应该改变你下次搭建分子性质预测流水线时的第一步。
如果你要引用它:引用 Table 4 和它的迁移学习结论。不要引用摘要中「三个数据集上优于或相当于 SOTA」的说法(真实战绩是 1 胜 1 平 2 负 + 1 项 SOTA 基线数值自相矛盾),也不要引用「指纹非互补」的结论(论文自己的数据显示融合在 20 个单元中的 10 个有效,且严格按数据域分层)。
如果你要在此基础上做研究:先做池化析因实验(§6.1③)。在把 sum 池化与 GIN 拆开之前,本文最重要的结论是不可归因的。
以下数值均非论文原文报告,由本人从 Table 2/3/4 的原始数值重新计算:
| 派生量 | 计算方法 | 出现位置 |
|---|---|---|
| 跨数据集平均排名 | 对每个数据集内 12 个方法按 RMSE 升序排名,跨 5 数据集取算术均值 | §2.5.2 |
| 与 SOTA 的相对差距 | (本文最优 − SOTA) / SOTA × 100% | §2.5.2、§2.7① |
| 指纹融合增益矩阵 | (GNN-FP − GNN) / GNN × 100%,20 个单元 | §2.5.3、图 1 |
| 架构相对跨度 | (max − min) / max × 100%,仅取 4 个纯 GNN | §2.5.4、图 2 |
| 显著性检验 | 双样本 t 检验,t = (x̄₂−x̄₁)/(s_p·√(2/n)),s_p = √((s₁²+s₂²)/2),n=3,df=4,t_crit,0.05 = 2.78 | §2.5.5 |
| 头→完全微调改善 | (仅头 − 完全) / 仅头 × 100% | §2.5.4、图 3 |