ICML 2025 SPOTLIGHT · AI4SCIENCE / TIME-SERIES XAI

TIMING:时间序列解释的路径重写

从 signed attribution 的评价漏洞,到连续片段随机积分路径

ICML 2025 Spotlight 2026-08-30 医疗与工业时序解释

TIMING 在六个真实数据集的 12 个 CPD 单元格全部领先,但最强证据来自作者与方法共同提出的指标,且 completeness 被主动放弃。

  • 日期:2026-08-30
  • 领域:AI4Science 与跨界 / 医疗与工业时序解释
  • 核心论文:Hyeongwon Jang, Changhun Kim, Eunho Yang. TIMING: Temporality-Aware Integrated Gradients for Time Series Explanation.
  • 会议:ICML 2025 Spotlight;PMLR 267:26877–26895。
  • 随机选择:候选池 24 篇;执行 shuf -i 1-24 -n 1,首次抽中第 14 篇;未重抽。

0. 链接验证表

下列链接均于 2026-08-30 实际访问。arXiv 页面显示 v1,2025-06-05;未发现后续版本。论文没有独立数据仓库,MIMIC-III 需通过 PhysioNet 凭证与 DUA 获取;公开仓库提供其余数据处理脚本及除 MIMIC-III 外的检查点。

对象 会议 / 论文 arXiv(版本与日期) 代码 数据 / 权重 项目页 / 视频
TIMING PMLR 正式页OpenReview 2506.05035v1,2025-06-05 官方 GitHub 仓库含脚本;README 链接非 MIMIC 检查点;MIMIC-III 受限 独立项目页未找到;独立视频未找到
Integrated Gradients 原论文 1703.01365,2017-03-04 未找到作者统一仓库 不适用 未找到
Dynamask ICML 2021 / PMLR PDF 2106.05303 官方 GitHub 仓库脚本;无统一权重包 未找到
TimeX++ ICML 2024 / arXiv 2405.09308v1,2024-05-15 官方 GitHub 仓库脚本;未找到统一权重包 Microsoft Research 条目;视频未找到
ContraLSP 论文入口见 TIMING 参考文献与官方实现依赖 未单独核实版本 实现入口 未找到统一权重包 未找到
近期 ORTE ICML 2025 OpenReview 未找到独立 arXiv 版本 公开仓库 未找到权重 ICML 视频页

1. 候选池与排重

索引显示近 14 天已经深度覆盖蛋白多模态、医疗 VLM 偏好优化、晶体生成与文档视觉解释,因此本次不再选这些主题。候选池来自 ICML 2025 PMLR / OpenReview、arXiv、作者代码与近期论文索引,共 24 篇:BounDr.E、Visual and Domain Knowledge for Medical Reasoning、QEM-Bench、KoNODE、Causal Discovery from Conditionally Stationary Time Series、Graph Filtration for Time Series、sciLaMA、TimeFilter、Flow-field Inference from Neural Data、Beyond Atoms、SPACE、Energy-based Alignment for Protein Ensembles、Moirai-MoE、TIMING、DUNIA、IMTS、Optimal Information Retention、Arrow、SKOLR、In-Context Fine-Tuning for TSFM、LSCD、Causality-Aware TS Anomaly Detection、E-prop Neural Similarity、Atomic Flow Matching for Ligand-Binding Proteins。完整可审计池保存在同目录 candidates_2026-08-30.tsv

2. Motivation:问题不是“归因不够平滑”,而是评价把方向信息消掉

时间序列解释通常输出每个 (t,d) 的重要性。若归因有符号,正值表示该点推高预测类概率,负值表示压低。常见评价一次遮掉 top-K 点,再观察准确率或目标类概率的变化。论文指出这会发生两个混淆。

第一,解释模型解释标签混淆。若模型学了伪相关,遮掉模型真正依赖的错误特征可能提高分类准确率;此时“准确率下降越多越忠实”把对 ground truth 的好坏错误地当作对模型行为的忠实度。第二,方向抵消。若 top-K 中包含推高和压低预测的点,一次性移除后的净变化可能接近零,即使排名完全正确;反之,一组排名较差但同方向的点会得到更大的净变化。

MIMIC-III 预实验直接量化了这件事:表 1 中 IG-Unsigned 的 CPD(K=50) 为 0.342±0.021,IG-Signed 为 0.248±0.010;但按 10% 遮挡后保留原预测的 Acc(越低越好),IG-Signed 为 0.855±0.011,反而显著好于 IG-Unsigned 的 0.974±0.001。这不是两个指标“略有不同”,而是会给出相反的算法排序(论文第 3 页,表 1)。

作者进一步指出原始 IG 的路径 αx 同时缩放所有时点:它既始终保持原序列的相对时间关系,也可能穿过训练分布之外的区域。因此,若关键证据来自“某一连续片段相对邻域被破坏时模型如何反应”,单一直线 IG 看不到这种条件变化(第 4–5 页,§4.2)。

3. 故事线、假设与权衡

论文的故事不是直接提出一个新 explainer,而是三步推进:

  1. 先证明旧评价会误判 signed attribution,提出 CPD 与 CPP;
  2. 在新指标下,朴素 IG 已超过许多时间序列专用方法;
  3. 再把 IG 的 baseline/path 随机化,并以连续片段而非独立点保留原值,得到 TIMING。

核心假设是:连续片段是时间语义的合适最小单元。这比独立 Bernoulli 掩码更尊重局部依赖,但并非从数据学习出来;s_min,s_max,n 是人工设定,且每个片段只选择一个通道。它因此偏向“单通道连续事件”,对跨通道同步事件、非连续周期模式或长程因果关系没有结构保证。

权衡也很明确:TIMING 换来多上下文的归因,却失去 IG 的 completeness。论文 Proposition 4.4 明确承认,所有归因之和不再保证等于 F(x)-F(x')(第 5 页)。换言之,TIMING 的数值不再是一笔严格守恒的“预测差额分账”,而是不同随机上下文下局部梯度的条件平均。

4. 方程级形式化

设分类器 F: R^(T×D) → [0,1]^C,预测类 ŷ=argmax_c F_c(x)。标准 IG 对点 (t,d)

IG_t,d(x) = (x_t,d-x'_t,d) ∫_0^1 ∂F_ŷ(x'+α(x-x'))/∂x_t,d dα.

论文以零 baseline 为主。令二值掩码 M_t,d=1 表示该点沿路径从 0 变化到输入,M_t,d=0 表示整条路径保留原值,则:

z(α;M) = α(M⊙x) + (1-M)⊙x
MaskingIG_t,d = x_t,d M_t,d ∫_0^1 ∂F_ŷ(z(α;M))/∂x_t,d dα.

RandIG 用独立 Bernoulli 掩码求条件期望;TIMING 则改用连续片段生成器 G(n,s_min,s_max) 定义掩码分布:

TIMING_t,d(x) = E_{M~G}[MaskingIG_t,d(x,M) | M_t,d=1].

Proposition 4.1 的计算技巧是把“多条完整 IG 路径”改成“每个 α 采一个随机掩码”,以单次 Riemann 求和近似内层期望。它保留 Sensitivity 与 Implementation Invariance(Proposition 4.2–4.3),但不保留 completeness(Proposition 4.4)。注意:论文称“maintaining its theoretical properties”时必须加限定词,准确说法是保留两项关键公理,而非完整继承 IG 的公理集合。

新评价指标按 |A| 从高到低依次遮挡,记 x↑k 为已移除前 k 个高归因点:

CPD(x)=Σ_{k=0}^{K-1} ||F(x↑k)-F(x↑(k+1))||_1  (越高越好)
CPP(x)=Σ_{k=0}^{K-1} ||F(x↓k)-F(x↓(k+1))||_1  (越低越好)

CPD 测“逐个移除重要点时输出累计移动多少”,CPP 对最低归因点做同样操作。因为每步取 L1 范数,它避免正负影响在一次 top-K 遮挡中直接抵消;但也因此累计的是路径长度而非首尾净位移,模型输出来回摆动会被重复计数。

算法流程(据附录 Algorithm 1,第 12 页)

输入 x、冻结分类器 F、片段数 n、长度区间 [s_min,s_max]、积分步数 n_samples
ŷ ← argmax F(x); TotalGrad ← 0; count ← 0
for α = 0, 1/n_samples, ... < 1:
    从零 baseline 构造插值点
    随机选择 n 个 (通道, 起点, 长度) 连续片段
    将这些片段恢复为 x 的原值,并记录哪些位置未被恢复
    对 F_ŷ 求输入梯度;恢复片段的梯度不计入该点条件平均
    累积梯度与有效计数
返回 (累计梯度 ⊙ x) / 每点有效计数

5. 关键机制与工程细节

组件 作用 论文配置 / 证据 工程含义
连续片段随机保留 打破部分局部关系,同时让样本靠近输入 MIMIC 默认 (n,s_min,s_max)=(50,10,48);表 6,第 8 页 对 48 小时时窗,片段可覆盖 10–48 小时,实际是很强的上下文干预
随机化积分路径 一条求和中近似多 baseline 期望 n_samples=50,代码与 Algorithm 1 成本约为 50 个梯度步,GPU 可批处理
逐点 CPD/CPP 防止一次 top-K 中正负作用抵消 §3.2,第 3–4 页 需 K 次前向遮挡;指标本身增加评估成本
零 / 均值替换 检查对替换规则的敏感性 表 3 同时报 Avg 与 Zero 仍不能保证替换样本在真实数据流形上
主分类器 主要实验为单层 200 hidden-unit GRU §5.1,第 6 页 附录表 8 再测 CNN、Transformer,但覆盖仅 MIMIC
计算硬件 解释评估在 RTX 3090 24GB 官方 README,2026-08-30 访问 论文正文未给全实验 GPU-hour
可复现性 官方仓库提供 124 次提交与运行脚本 README 明示“训练环境差异导致仅靠脚本可能不能完全复现” 这是作者公开的实质限制,不应被“代码已开源”掩盖

代码审计还发现,六个真实数据集使用不同片段配置:例如 Freezer 为 (5,10,100)、Wafer (5,10,152)、Boiler (50,1,36)、PAM (10,10,600)、Epilepsy (10,10,10)、MIMIC (50,10,48)(官方仓库 scripts/real/run_10perc_masking_our.sh)。所以“同一方法跨数据集无需调参”并不成立;表 6 只在 MIMIC 上做敏感性分析。

6. 数据集、任务与指标

表 7(附录第 15 页)列出 8 个基准:Switch-Feature 1,000×100×3、State 1,000×200×3;MIMIC-III 22,988×48×32,PAM 5,333×600×17,Epilepsy 11,500×178×1,Boiler 90,115×36×20,Wafer 7,164×152×1,Freezer 3,000×301×1。任务覆盖合成显著性、ICU 院内死亡、活动识别、EEG 癫痫、锅炉故障、晶圆异常与冰箱来源分类。

合成数据可用 AUP/AUR 对照生成过程给出的 saliency map,但这默认训练模型确实用了生成器规定的点;真实数据没有 ground-truth explanation,故 CPD/CPP、Acc、CE、Sufficiency、Comprehensiveness 都是代理指标。CPD 高只能说明按该排序逐个替换时模型输出累计变化大,不能说明临床人员认为解释正确,也不能证明被标出的变量是因果风险因素。

7. 完整主结果矩阵

7.1 六真实数据集 × 七方法 × 两替换规则

下表完整转录论文表 3(第 7 页),指标均为 10% masking 的 CPD,五次交叉验证 mean±SE,越高越好。粗体表示逐列最优。为避免伪精度,提升只对 TIMING 与逐列第二名 IG 的均值计算。

方法 MIMIC Avg MIMIC Zero PAM Avg PAM Zero Boiler Avg Boiler Zero Epilepsy Avg Epilepsy Zero Wafer Avg Wafer Zero Freezer Avg Freezer Zero
AFO .127±.009 .227±.017 .140±.009 .200±.013 .262±.020 .349±.035 .028±.003 .030±.004 .018±.003 .018±.003 .143±.054 .143±.054
GradSHAP .250±.015 .522±.038 .421±.014 .518±.012 .752±.055 .747±.092 .052±.004 .054±.004 .485±.014 .485±.014 .397±.110 .397±.110
Extrmask .154±.008 .305±.010 .291±.007 .380±.009 .338±.028 .400±.031 .028±.003 .029±.003 .202±.026 .202±.026 .176±.057 .176±.057
ContraLSP .048±.003 .051±.004 .046±.007 .059±.011 .408±.035 .496±.043 .016±.001 .016±.001 .121±.032 .121±.032 .176±.055 .176±.055
TimeX++ .017±.002 .074±.006 .057±.004 .070±.004 .124±.028 .208±.043 .030±.004 .032±.004 .000±.000 .000±.000 .216±.056 .216±.056
IG .243±.015 .549±.039 .448±.013 .573±.022 .759±.053 .752±.013 .052±.004 .054±.004 .500±.017 .500±.017 .405±.111 .405±.111
TIMING .250±.015 .597±.037 .463±.007 .602±.033 1.259±.065 1.578±.085 .057±.005 .060±.005 .674±.014 .674±.014 .409±.109 .409±.109

相对 IG:MIMIC Zero +0.048 / +8.74%;PAM Zero +0.029 / +5.06%;Boiler Zero +0.826 / +109.84%;Epilepsy Zero +0.006 / +11.11%;Wafer Zero +0.174 / +34.80%;Freezer Zero +0.004 / +0.99%。论文摘要式说法“跨数据集 SOTA”在点估计上成立,但优势极不均匀:Freezer 几乎打平,Boiler 则翻倍。

7.2 MIMIC 多指标:新指标赢,旧指标不统一

论文表 2(第 6 页)中,TIMING 的 CPD K=50/100 为 0.366±0.021 / 0.505±0.029,IG 为 0.342±0.021 / 0.469±0.030,绝对提升 0.024 / 0.036。但 20% masking 的 Acc 为 TIMING 0.975±0.002、Extrmask 0.932±0.005、ContraLSP 0.921±0.006(越低越好);CE 为 TIMING 0.136±0.008、Extrmask 0.485±0.022(越高越好);Comprehensiveness×100 为 TIMING 0.436±0.562、Extrmask 23.370±1.088。因此 TIMING 的领先是“在作者认为更公平的新指标上领先”,不是所有既有 fidelity 指标一致领先。

7.3 合成数据暴露“模型忠实度”与“数据生成真值”的张力

表 4(第 8 页)中,Switch-Feature 的 TIMING CPD 0.208±0.003 为最佳,但 AUP/AUR 0.926±0.011 / 0.434±0.015;ContraLSP 的 AUP/AUR 为 0.970±0.005 / 0.851±0.005。在 State,TIMING CPD 0.163±0.002 与 LIME 0.163±0.002 并列点估计最佳,但 AUP/AUR 0.921±0.010 / 0.355±0.008,低于 LIME AUP 0.944±0.008、FIT AUR 0.607±0.002。这说明 TIMING 更像“解释已训练模型正在用什么”,未必最接近生成过程指定的 ground-truth salient set。

8. 逐层消融、超参、相变与统计

表 5(第 8 页)把 IG→RandIG→TIMING 分层:MIMIC Zero CPD 从 IG 0.342±0.021,到 RandIG(p=.3/.5/.7) 0.350/.353/.354±约.022,再到 TIMING 0.366±0.021。随机 baseline 贡献约 +0.012,连续片段在最强 RandIG 上再 +0.012;两步增益同量级,不能把全部提升归给“temporality”。Avg 替换下 TIMING 仅从 IG 0.172 升到 0.177

表 6(第 8 页)给 12 组 MIMIC 超参。Zero CPD 范围 0.345–0.366,绝对跨度 0.021;Avg 0.173–0.177,跨度其实是 0.004。正文写“average performance 最大差异 0.04”,与表内数字不一致,合理推断是排版小数点错误。较大 s_max=48 基本优于 s_max=10,但没有出现突变式相变;n 从 10 到 100 也非单调。

统计方面,主表报告五次交叉验证的 mean±standard error,这是优点;但论文未报告配对显著性检验、置信区间、效应量或多重比较校正。因此 Freezer 的 +0.004(SE 各约 0.11)不能据表推出统计显著;即使 Boiler 的差距远大于 SE,也不能把视觉分离当作正式检验。不同方法若共享同一 folds,最合适的是按 fold 配对检验或 bootstrap 配对差,并报告 12 列多重比较控制。

9. 计算效率

图 4(第 9 页)报告 MIMIC 全测试集的秒/样本与 CPD:DeepLIFT 0.017 s, 0.142;IG 0.034 s, 0.342;GradSHAP 0.034 s, 0.327;TIMING 0.040 s, 0.366;FO 2.948 s, 0.016;AFO 3.540 s, 0.120;LIME 3.742 s, 0.071。TIMING 相对 IG 慢约 17.65%,CPD 高约 7.02%;相对 AFO 快约 88.5×。但作者把需要 post-training 的方法排除在这张图之外,因此无法得出“比所有时间序列 XAI 方法更快”的结论。

10. 真正贡献、可复用设计与迁移潜力

真正贡献有两层。第一层甚至比 TIMING 本身更重要:CPD/CPP 把“一次遮 K 个点”改成逐步路径,明确揭示 signed attribution 的抵消问题。它可迁移到图节点、图像 patch、文本 token,只要能定义替换操作。第二层是把 structured baseline distribution 放进 IG 路径:不是另训 explainer,而是通过输入路径编码领域结构;这可复用到空间连通块、频域带宽、事件窗口或多变量同步块。

不过迁移时应保留三条设计纪律:结构单元必须由领域假设或数据验证支持;替换器需尽量贴近条件数据分布;不能只在与方法共同提出的指标上验证,至少加入外部 ground truth、反事实一致性、人类任务或下游调试收益。

11. 相关工作:问题来源与技术来源链

11.1 Integrated Gradients(Sundararajan et al., 2017)

它解决“无需改模型、满足 Sensitivity 与 Implementation Invariance 的输入归因”,并以 completeness 把归因总和约束为输出差。遗留缺口是 baseline 与路径未表达时间结构,直线缩放可能 OOD。TIMING 继承梯度积分和两项公理,把 baseline/path 变成结构化随机变量;关键设计传递是“路径即干预语义”。代价是 completeness 被放弃。

11.2 Dynamask(Crabbé & van der Schaar, ICML 2021)

Dynamask 通过优化动态 mask 强制稀疏、连续、易读,直接回应高维时序的可读性。遗留缺口是每个样本要做优化,且性能高度依赖替换与评价;TIMING 用固定梯度积分避免 per-instance mask training/optimization。传递下来的设计是“连续时间结构应进入扰动”,但 TIMING 从优化 mask 转向随机片段路径。

11.3 TimeX++(Liu et al., ICML 2024)

TimeX++ 用信息瓶颈、解释提取器和 conditioner 生成 in-distribution、label-preserving 的 explanation-embedded instance,解决 mask signalling 与分布漂移。遗留缺口是需要学习额外模块,且论文表 2/3 显示其在 CPD 上很低。TIMING 不训练生成器,改由部分保留原序列让路径靠近输入。传递的设计是“解释评估的替换样本不能任意 OOD”,但 TIMING 只做启发式缓解,没有密度或判别器证据证明路径在分布内。

11.4 ContraLSP(Liu et al., 2024)

ContraLSP 以对比学习和稀疏 gate 提取局部显著点,在既有 Acc、Suff、Comp 上强。遗留缺口是 unsigned / zeroed negative importance 会漏掉压低预测的证据。TIMING 以绝对值排序并在 CPD/CPP 中逐步遮挡正负证据。传递的是“解释需要稀疏且局部”,但 TIMING 并不直接优化稀疏性。

                         ┌─ 梯度公理线 ─ IG (2017) ───────────────┐
模型无关局部解释 ────────┤                                      ├─ TIMING (2025)
                         └─ 时序扰动线 ─ Dynamask (2021) ────────┤   ├─ CPD/CPP:逐步评价
                                           ├─ ContraLSP (2024) ──┤   └─ 连续片段随机路径
                                           └─ TimeX++ (2024) ────┘
                                                     │
                                   OOD / signalling / 方向抵消成为转折点
方法 是否训练额外解释器 时间结构 signed 主要保证 TIMING 表 2 CPD50
IG Sensitivity、Implementation Invariance、Completeness .342±.021
Dynamask 每样本优化 mask 动态连续 mask 通常无符号 稀疏 / legibility 目标 .052±.002
ContraLSP 局部稀疏 gate 主要无符号 对比与稀疏目标 .013±.001
TimeX++ conditioner 生成时序 主要无符号 信息瓶颈近似与分布约束 .027±.002
TIMING 随机连续片段路径 Sensitivity、Implementation Invariance;不 complete .366±.021

12. 论文自述限制

  1. 评价可被符号排序操纵。 §3.2(第 4 页)明确说 signed 方法若按绝对值顺序交替正负点,可能抬高 CPD/CPP,因此不应利用符号操纵排序。
  2. Completeness 丢失。 Proposition 4.4 与其后讨论(第 5–6 页)明确说明归因和不再等于输出差。
  3. 复现环境不一致。 官方 README 明示,公开训练脚本因与原训练环境不同,可能无法单独完全复现论文结果;MIMIC 模型检查点也因访问限制不公开。

论文没有独立的“Limitations”章节,也未报告用户研究、因果验证或部署测试。

13. 独立批判(证据 → 推论)

  1. [指标构念效度] 因为 CPD 是逐步输出变化的 L1 和,满足三角不等式 CPD ≥ ||F(x)-F(x↑K)||₁,路径来回摆动会重复累计,所以高 CPD 不必然等于更准确地识别净贡献,可能只是遮挡轨迹更曲折。
  2. [循环验证] 因为核心方法与主要胜出指标由同一论文共同提出,且在既有 Acc/CE/Comp 上 Extrmask 明显更强(表 2:Comp×100 23.370 对 0.436),所以不能用 CPD 全胜单独证明普遍解释质量更高;需要外部任务或独立 ground truth。
  3. [统计] 因为 Freezer Zero 仅从 IG .405±.111 到 .409±.109,差 0.004 远小于单个方法 SE,所以“六数据集一致提升”的点估计事实不能推出 Freezer 上可靠改善。
  4. [归因守恒] 因为 TIMING 明确不满足 completeness,所以不同样本或不同片段超参下归因总量未被固定,进而绝对归因大小的跨样本比较缺少 IG 原有的标尺。
  5. [OOD 证据缺失] 因为论文声称部分保留能缓解 OOD,却未报告路径样本的密度、判别器 AUC、最近邻距离或 calibration,所以“更 in-distribution”目前是合理机制假说,不是被直接验证的实验结论。
  6. [结构偏置] 因为随机片段一次只选一个通道,PAM 的 17 通道同步动作、Boiler 的 20 传感器耦合并未显式成组,所以方法可能把跨通道事件拆散;Boiler 的大幅增益也不能说明学到了物理耦合。
  7. [超参外推] 因为六数据集脚本使用不同 (n,s_min,s_max),而敏感性只在 MIMIC 的 T=48 上报告,所以无法推出对 T=600 的 PAM 或 T=301 的 Freezer 同样稳健。
  8. [复现性] 因为 README 明确警告训练脚本不能完整复现且不公开 MIMIC 检查点,所以最关键的医疗主表无法由无数据权限的第三方端到端验证;这限制了审计可达性。

14. 开放挑战:可操作的 head-to-head 实验空白

理论

  • CPD vs 净位移 vs 单调路径 CPD: 固定同一 attribution ranking,构造输出往返但终点相同的合成模型,比较三种指标与已知 feature contribution 的 Kendall τ;检验 CPD 是否奖励振荡。
  • 守恒版 TIMING vs 原 TIMING: 对随机路径归因做逐样本投影使总和等于 F(x)-F(x'),在 CPD、AUP/AUR、跨样本 calibration 上 head-to-head,判断 completeness 是否能无损恢复。
  • 片段先验 vs 学习结构: 单通道连续片段、跨通道 group-lasso 片段、频域周期块三者在已知交互真值合成数据上比较 interaction recovery。

工程与应用

  • 等前向/反向预算: TIMING、IG、GradSHAP、StartGrad、TimeX++ 固定 50 次模型调用与同一 GPU,报告吞吐、峰值显存、CPD、AUP/AUR和能耗;当前图 4 排除了训练型方法。
  • 真实临床用户研究: 对 MIMIC 病例盲测 TIMING、IG、Extrmask,让重症医师判断证据方向、定位错误和处置建议;主要终点是错误发现率与用时,不使用作者自定义指标。
  • 替换器鲁棒性: 零、均值、条件扩散 imputer、最近邻真实片段四种替换在所有方法上全交叉;若算法排序随替换器逆转,则报告 ranking stability 而非单点 SOTA。

新兴方向

  • 在线风险变化: TIMING 与 DeltaSHAP 在连续预测差 F(x_t)-F(x_{t-1}) 上比较;检验解释静态风险与解释风险变化是否需要不同 Shapley/gradient 目标。
  • 跨域解释: TIMING 时间片段路径与 Cross-domain IG 的频域路径在 EEG、振动信号上比较临床/物理语义;终点包含频带 ground truth、completeness 与人类识别率。

15. 近期工作雷达

  1. Optimal Information Retention / ORTE,ICML 2025:用条件互信息统一冗余与完整性,正面补 TIMING 缺少全局优化准则的问题;但它仍依赖 mask 学习与互信息近似。
  2. Start Smart / StartGrad,ICLR 2025:用梯度初始化 mask 优化,连接快速梯度法与高质量扰动法;适合作为等预算强基线。
  3. DeltaSHAP,2025-07-03 arXiv:解释在线患者风险的“变化”而非静态分数,方向性与实时性更贴近临床监控。
  4. Cross-domain Integrated Gradients,2025-05-19 arXiv:把 IG 推到频域、ICA 与分解域并保留 completeness;它提醒 TIMING 的“连续时间片段”不是唯一合理语义单元。
  5. TimeSAE,2026-01-14 arXiv:以稀疏解码器寻找可解释时间概念,将 point attribution 推向 concept-level;忠实度仍需与黑箱行为验证。
  6. Delta-XAI,OpenReview:试图统一预测演化解释;它延续 TIMING 对方向信息的关注,但需避免再造只利于自身的评价闭环。

16. 结论

TIMING 最值得读的部分不是“又一个时序归因器”,而是对评价协议的拆解:一次遮掉 top-K 确实会让正负证据相互抵消。方法上,连续片段随机路径是一种便宜、模型无关、可迁移的结构先验;六真实数据集 12/12 CPD 单元格领先,Boiler Zero 相对 IG +109.84%,且只把 MIMIC 推理从 IG 的 0.034 s/样本增加到 0.040 s/样本

但严格结论必须收窄:TIMING 没有在所有既有指标上获胜,不保证 completeness,没有直接证明路径更 in-distribution,也没有用户或因果解释验证。最稳妥的定位是:它是“signed attribution 公平评价 + 结构化 IG 路径”的强基线与研究起点,而不是已完成临床可信解释闭环的方法。


脚注:候选池与报告索引已更新。报告数字均来自实际读取的 TIMING 论文 v1 PDF(19 页)、附录或官方代码/README;未能核实的项目均明确标注。Warm Editorial 验证器以 0 error / 0 warning 通过;本机虽安装 Playwright,但 /usr/bin/chromium/opt/pw-browsers 与 Playwright 缓存均无 Chromium 可执行文件(启动返回 executable missing),故无法诚实完成浏览器截图。报告改以响应式断点、宽表滚动、主题 CSS/JS、SVG 键盘 tooltip 与静态结构检查作为替代,未声称完成真实浏览器视觉验收。

六个真实数据集:Zero 替换 CPD(TIMING vs IG)

TIMING 在六列点估计均领先;Boiler 差距最大,Freezer 几乎持平。纵轴为 CPD,越高越好。

TIMINGIG
TIMING 与 IG 在六个真实数据集的 Zero 替换 CPDBoiler 上 TIMING 1.578、IG 0.752,差距最大;Freezer 上分别为 0.409 和 0.405。0.00.40.81.21.6MIMICPAMBoilerEpilepsyWaferFreezer
数据来源:TIMING 论文表 3,第 7 页;单位:CPD。完整 mean±SE 数值见正文表。