- 日期:2026-08-30
- 领域:AI4Science 与跨界 / 医疗与工业时序解释
- 核心论文:Hyeongwon Jang, Changhun Kim, Eunho Yang. TIMING: Temporality-Aware Integrated Gradients for Time Series Explanation.
- 会议:ICML 2025 Spotlight;PMLR 267:26877–26895。
- 随机选择:候选池 24 篇;执行
shuf -i 1-24 -n 1,首次抽中第 14 篇;未重抽。
0. 链接验证表
下列链接均于 2026-08-30 实际访问。arXiv 页面显示 v1,2025-06-05;未发现后续版本。论文没有独立数据仓库,MIMIC-III 需通过 PhysioNet 凭证与 DUA 获取;公开仓库提供其余数据处理脚本及除 MIMIC-III 外的检查点。
| 对象 | 会议 / 论文 | arXiv(版本与日期) | 代码 | 数据 / 权重 | 项目页 / 视频 |
|---|---|---|---|---|---|
| TIMING | PMLR 正式页;OpenReview | 2506.05035v1,2025-06-05 | 官方 GitHub | 仓库含脚本;README 链接非 MIMIC 检查点;MIMIC-III 受限 | 独立项目页未找到;独立视频未找到 |
| Integrated Gradients | 原论文 | 1703.01365,2017-03-04 | 未找到作者统一仓库 | 不适用 | 未找到 |
| Dynamask | ICML 2021 / PMLR PDF | 2106.05303 | 官方 GitHub | 仓库脚本;无统一权重包 | 未找到 |
| TimeX++ | ICML 2024 / arXiv | 2405.09308v1,2024-05-15 | 官方 GitHub | 仓库脚本;未找到统一权重包 | Microsoft Research 条目;视频未找到 |
| ContraLSP | 论文入口见 TIMING 参考文献与官方实现依赖 | 未单独核实版本 | 实现入口 | 未找到统一权重包 | 未找到 |
| 近期 ORTE | ICML 2025 OpenReview | 未找到独立 arXiv 版本 | 公开仓库 | 未找到权重 | ICML 视频页 |
1. 候选池与排重
索引显示近 14 天已经深度覆盖蛋白多模态、医疗 VLM
偏好优化、晶体生成与文档视觉解释,因此本次不再选这些主题。候选池来自
ICML 2025 PMLR / OpenReview、arXiv、作者代码与近期论文索引,共 24
篇:BounDr.E、Visual and Domain Knowledge for Medical
Reasoning、QEM-Bench、KoNODE、Causal Discovery from Conditionally
Stationary Time Series、Graph Filtration for Time
Series、sciLaMA、TimeFilter、Flow-field Inference from Neural
Data、Beyond Atoms、SPACE、Energy-based Alignment for Protein
Ensembles、Moirai-MoE、TIMING、DUNIA、IMTS、Optimal Information
Retention、Arrow、SKOLR、In-Context Fine-Tuning for
TSFM、LSCD、Causality-Aware TS Anomaly Detection、E-prop Neural
Similarity、Atomic Flow Matching for Ligand-Binding
Proteins。完整可审计池保存在同目录
candidates_2026-08-30.tsv。
2. Motivation:问题不是“归因不够平滑”,而是评价把方向信息消掉
时间序列解释通常输出每个 (t,d)
的重要性。若归因有符号,正值表示该点推高预测类概率,负值表示压低。常见评价一次遮掉
top-K 点,再观察准确率或目标类概率的变化。论文指出这会发生两个混淆。
第一,解释模型与解释标签混淆。若模型学了伪相关,遮掉模型真正依赖的错误特征可能提高分类准确率;此时“准确率下降越多越忠实”把对 ground truth 的好坏错误地当作对模型行为的忠实度。第二,方向抵消。若 top-K 中包含推高和压低预测的点,一次性移除后的净变化可能接近零,即使排名完全正确;反之,一组排名较差但同方向的点会得到更大的净变化。
MIMIC-III 预实验直接量化了这件事:表 1 中 IG-Unsigned 的 CPD(K=50) 为 0.342±0.021,IG-Signed 为 0.248±0.010;但按 10% 遮挡后保留原预测的 Acc(越低越好),IG-Signed 为 0.855±0.011,反而显著好于 IG-Unsigned 的 0.974±0.001。这不是两个指标“略有不同”,而是会给出相反的算法排序(论文第 3 页,表 1)。
作者进一步指出原始 IG 的路径 αx
同时缩放所有时点:它既始终保持原序列的相对时间关系,也可能穿过训练分布之外的区域。因此,若关键证据来自“某一连续片段相对邻域被破坏时模型如何反应”,单一直线
IG 看不到这种条件变化(第 4–5 页,§4.2)。
3. 故事线、假设与权衡
论文的故事不是直接提出一个新 explainer,而是三步推进:
- 先证明旧评价会误判 signed attribution,提出 CPD 与 CPP;
- 在新指标下,朴素 IG 已超过许多时间序列专用方法;
- 再把 IG 的 baseline/path 随机化,并以连续片段而非独立点保留原值,得到 TIMING。
核心假设是:连续片段是时间语义的合适最小单元。这比独立
Bernoulli
掩码更尊重局部依赖,但并非从数据学习出来;s_min,s_max,n
是人工设定,且每个片段只选择一个通道。它因此偏向“单通道连续事件”,对跨通道同步事件、非连续周期模式或长程因果关系没有结构保证。
权衡也很明确:TIMING 换来多上下文的归因,却失去 IG 的
completeness。论文 Proposition 4.4 明确承认,所有归因之和不再保证等于
F(x)-F(x')(第 5 页)。换言之,TIMING
的数值不再是一笔严格守恒的“预测差额分账”,而是不同随机上下文下局部梯度的条件平均。
4. 方程级形式化
设分类器 F: R^(T×D) → [0,1]^C,预测类
ŷ=argmax_c F_c(x)。标准 IG 对点 (t,d):
IG_t,d(x) = (x_t,d-x'_t,d) ∫_0^1 ∂F_ŷ(x'+α(x-x'))/∂x_t,d dα.
论文以零 baseline 为主。令二值掩码 M_t,d=1
表示该点沿路径从 0 变化到输入,M_t,d=0
表示整条路径保留原值,则:
z(α;M) = α(M⊙x) + (1-M)⊙x
MaskingIG_t,d = x_t,d M_t,d ∫_0^1 ∂F_ŷ(z(α;M))/∂x_t,d dα.
RandIG 用独立 Bernoulli 掩码求条件期望;TIMING 则改用连续片段生成器
G(n,s_min,s_max) 定义掩码分布:
TIMING_t,d(x) = E_{M~G}[MaskingIG_t,d(x,M) | M_t,d=1].
Proposition 4.1 的计算技巧是把“多条完整 IG 路径”改成“每个 α 采一个随机掩码”,以单次 Riemann 求和近似内层期望。它保留 Sensitivity 与 Implementation Invariance(Proposition 4.2–4.3),但不保留 completeness(Proposition 4.4)。注意:论文称“maintaining its theoretical properties”时必须加限定词,准确说法是保留两项关键公理,而非完整继承 IG 的公理集合。
新评价指标按 |A| 从高到低依次遮挡,记 x↑k
为已移除前 k 个高归因点:
CPD(x)=Σ_{k=0}^{K-1} ||F(x↑k)-F(x↑(k+1))||_1 (越高越好)
CPP(x)=Σ_{k=0}^{K-1} ||F(x↓k)-F(x↓(k+1))||_1 (越低越好)
CPD 测“逐个移除重要点时输出累计移动多少”,CPP 对最低归因点做同样操作。因为每步取 L1 范数,它避免正负影响在一次 top-K 遮挡中直接抵消;但也因此累计的是路径长度而非首尾净位移,模型输出来回摆动会被重复计数。
算法流程(据附录 Algorithm 1,第 12 页)
输入 x、冻结分类器 F、片段数 n、长度区间 [s_min,s_max]、积分步数 n_samples
ŷ ← argmax F(x); TotalGrad ← 0; count ← 0
for α = 0, 1/n_samples, ... < 1:
从零 baseline 构造插值点
随机选择 n 个 (通道, 起点, 长度) 连续片段
将这些片段恢复为 x 的原值,并记录哪些位置未被恢复
对 F_ŷ 求输入梯度;恢复片段的梯度不计入该点条件平均
累积梯度与有效计数
返回 (累计梯度 ⊙ x) / 每点有效计数
5. 关键机制与工程细节
| 组件 | 作用 | 论文配置 / 证据 | 工程含义 |
|---|---|---|---|
| 连续片段随机保留 | 打破部分局部关系,同时让样本靠近输入 | MIMIC 默认 (n,s_min,s_max)=(50,10,48);表 6,第 8
页 |
对 48 小时时窗,片段可覆盖 10–48 小时,实际是很强的上下文干预 |
| 随机化积分路径 | 一条求和中近似多 baseline 期望 | n_samples=50,代码与 Algorithm 1 |
成本约为 50 个梯度步,GPU 可批处理 |
| 逐点 CPD/CPP | 防止一次 top-K 中正负作用抵消 | §3.2,第 3–4 页 | 需 K 次前向遮挡;指标本身增加评估成本 |
| 零 / 均值替换 | 检查对替换规则的敏感性 | 表 3 同时报 Avg 与 Zero | 仍不能保证替换样本在真实数据流形上 |
| 主分类器 | 主要实验为单层 200 hidden-unit GRU | §5.1,第 6 页 | 附录表 8 再测 CNN、Transformer,但覆盖仅 MIMIC |
| 计算硬件 | 解释评估在 RTX 3090 24GB | 官方 README,2026-08-30 访问 | 论文正文未给全实验 GPU-hour |
| 可复现性 | 官方仓库提供 124 次提交与运行脚本 | README 明示“训练环境差异导致仅靠脚本可能不能完全复现” | 这是作者公开的实质限制,不应被“代码已开源”掩盖 |
代码审计还发现,六个真实数据集使用不同片段配置:例如 Freezer 为
(5,10,100)、Wafer (5,10,152)、Boiler
(50,1,36)、PAM (10,10,600)、Epilepsy
(10,10,10)、MIMIC (50,10,48)(官方仓库
scripts/real/run_10perc_masking_our.sh)。所以“同一方法跨数据集无需调参”并不成立;表
6 只在 MIMIC 上做敏感性分析。
6. 数据集、任务与指标
表 7(附录第 15 页)列出 8 个基准:Switch-Feature 1,000×100×3、State 1,000×200×3;MIMIC-III 22,988×48×32,PAM 5,333×600×17,Epilepsy 11,500×178×1,Boiler 90,115×36×20,Wafer 7,164×152×1,Freezer 3,000×301×1。任务覆盖合成显著性、ICU 院内死亡、活动识别、EEG 癫痫、锅炉故障、晶圆异常与冰箱来源分类。
合成数据可用 AUP/AUR 对照生成过程给出的 saliency map,但这默认训练模型确实用了生成器规定的点;真实数据没有 ground-truth explanation,故 CPD/CPP、Acc、CE、Sufficiency、Comprehensiveness 都是代理指标。CPD 高只能说明按该排序逐个替换时模型输出累计变化大,不能说明临床人员认为解释正确,也不能证明被标出的变量是因果风险因素。
7. 完整主结果矩阵
7.1 六真实数据集 × 七方法 × 两替换规则
下表完整转录论文表 3(第 7 页),指标均为 10% masking 的
CPD,五次交叉验证
mean±SE,越高越好。粗体表示逐列最优。为避免伪精度,提升只对
TIMING 与逐列第二名 IG 的均值计算。
| 方法 | MIMIC Avg | MIMIC Zero | PAM Avg | PAM Zero | Boiler Avg | Boiler Zero | Epilepsy Avg | Epilepsy Zero | Wafer Avg | Wafer Zero | Freezer Avg | Freezer Zero |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AFO | .127±.009 | .227±.017 | .140±.009 | .200±.013 | .262±.020 | .349±.035 | .028±.003 | .030±.004 | .018±.003 | .018±.003 | .143±.054 | .143±.054 |
| GradSHAP | .250±.015 | .522±.038 | .421±.014 | .518±.012 | .752±.055 | .747±.092 | .052±.004 | .054±.004 | .485±.014 | .485±.014 | .397±.110 | .397±.110 |
| Extrmask | .154±.008 | .305±.010 | .291±.007 | .380±.009 | .338±.028 | .400±.031 | .028±.003 | .029±.003 | .202±.026 | .202±.026 | .176±.057 | .176±.057 |
| ContraLSP | .048±.003 | .051±.004 | .046±.007 | .059±.011 | .408±.035 | .496±.043 | .016±.001 | .016±.001 | .121±.032 | .121±.032 | .176±.055 | .176±.055 |
| TimeX++ | .017±.002 | .074±.006 | .057±.004 | .070±.004 | .124±.028 | .208±.043 | .030±.004 | .032±.004 | .000±.000 | .000±.000 | .216±.056 | .216±.056 |
| IG | .243±.015 | .549±.039 | .448±.013 | .573±.022 | .759±.053 | .752±.013 | .052±.004 | .054±.004 | .500±.017 | .500±.017 | .405±.111 | .405±.111 |
| TIMING | .250±.015 | .597±.037 | .463±.007 | .602±.033 | 1.259±.065 | 1.578±.085 | .057±.005 | .060±.005 | .674±.014 | .674±.014 | .409±.109 | .409±.109 |
相对 IG:MIMIC Zero +0.048 / +8.74%;PAM Zero +0.029 / +5.06%;Boiler Zero +0.826 / +109.84%;Epilepsy Zero +0.006 / +11.11%;Wafer Zero +0.174 / +34.80%;Freezer Zero +0.004 / +0.99%。论文摘要式说法“跨数据集 SOTA”在点估计上成立,但优势极不均匀:Freezer 几乎打平,Boiler 则翻倍。
7.2 MIMIC 多指标:新指标赢,旧指标不统一
论文表 2(第 6 页)中,TIMING 的 CPD K=50/100 为 0.366±0.021 / 0.505±0.029,IG 为 0.342±0.021 / 0.469±0.030,绝对提升 0.024 / 0.036。但 20% masking 的 Acc 为 TIMING 0.975±0.002、Extrmask 0.932±0.005、ContraLSP 0.921±0.006(越低越好);CE 为 TIMING 0.136±0.008、Extrmask 0.485±0.022(越高越好);Comprehensiveness×100 为 TIMING 0.436±0.562、Extrmask 23.370±1.088。因此 TIMING 的领先是“在作者认为更公平的新指标上领先”,不是所有既有 fidelity 指标一致领先。
7.3 合成数据暴露“模型忠实度”与“数据生成真值”的张力
表 4(第 8 页)中,Switch-Feature 的 TIMING CPD 0.208±0.003 为最佳,但 AUP/AUR 0.926±0.011 / 0.434±0.015;ContraLSP 的 AUP/AUR 为 0.970±0.005 / 0.851±0.005。在 State,TIMING CPD 0.163±0.002 与 LIME 0.163±0.002 并列点估计最佳,但 AUP/AUR 0.921±0.010 / 0.355±0.008,低于 LIME AUP 0.944±0.008、FIT AUR 0.607±0.002。这说明 TIMING 更像“解释已训练模型正在用什么”,未必最接近生成过程指定的 ground-truth salient set。
8. 逐层消融、超参、相变与统计
表 5(第 8 页)把 IG→RandIG→TIMING 分层:MIMIC Zero CPD 从 IG 0.342±0.021,到 RandIG(p=.3/.5/.7) 0.350/.353/.354±约.022,再到 TIMING 0.366±0.021。随机 baseline 贡献约 +0.012,连续片段在最强 RandIG 上再 +0.012;两步增益同量级,不能把全部提升归给“temporality”。Avg 替换下 TIMING 仅从 IG 0.172 升到 0.177。
表 6(第 8 页)给 12 组 MIMIC 超参。Zero CPD 范围
0.345–0.366,绝对跨度 0.021;Avg
0.173–0.177,跨度其实是
0.004。正文写“average performance 最大差异
0.04”,与表内数字不一致,合理推断是排版小数点错误。较大
s_max=48 基本优于
s_max=10,但没有出现突变式相变;n 从 10 到 100
也非单调。
统计方面,主表报告五次交叉验证的 mean±standard error,这是优点;但论文未报告配对显著性检验、置信区间、效应量或多重比较校正。因此 Freezer 的 +0.004(SE 各约 0.11)不能据表推出统计显著;即使 Boiler 的差距远大于 SE,也不能把视觉分离当作正式检验。不同方法若共享同一 folds,最合适的是按 fold 配对检验或 bootstrap 配对差,并报告 12 列多重比较控制。
9. 计算效率
图 4(第 9 页)报告 MIMIC 全测试集的秒/样本与 CPD:DeepLIFT 0.017 s, 0.142;IG 0.034 s, 0.342;GradSHAP 0.034 s, 0.327;TIMING 0.040 s, 0.366;FO 2.948 s, 0.016;AFO 3.540 s, 0.120;LIME 3.742 s, 0.071。TIMING 相对 IG 慢约 17.65%,CPD 高约 7.02%;相对 AFO 快约 88.5×。但作者把需要 post-training 的方法排除在这张图之外,因此无法得出“比所有时间序列 XAI 方法更快”的结论。
10. 真正贡献、可复用设计与迁移潜力
真正贡献有两层。第一层甚至比 TIMING 本身更重要:CPD/CPP 把“一次遮 K 个点”改成逐步路径,明确揭示 signed attribution 的抵消问题。它可迁移到图节点、图像 patch、文本 token,只要能定义替换操作。第二层是把 structured baseline distribution 放进 IG 路径:不是另训 explainer,而是通过输入路径编码领域结构;这可复用到空间连通块、频域带宽、事件窗口或多变量同步块。
不过迁移时应保留三条设计纪律:结构单元必须由领域假设或数据验证支持;替换器需尽量贴近条件数据分布;不能只在与方法共同提出的指标上验证,至少加入外部 ground truth、反事实一致性、人类任务或下游调试收益。
11. 相关工作:问题来源与技术来源链
11.1 Integrated Gradients(Sundararajan et al., 2017)
它解决“无需改模型、满足 Sensitivity 与 Implementation Invariance 的输入归因”,并以 completeness 把归因总和约束为输出差。遗留缺口是 baseline 与路径未表达时间结构,直线缩放可能 OOD。TIMING 继承梯度积分和两项公理,把 baseline/path 变成结构化随机变量;关键设计传递是“路径即干预语义”。代价是 completeness 被放弃。
11.2 Dynamask(Crabbé & van der Schaar, ICML 2021)
Dynamask 通过优化动态 mask 强制稀疏、连续、易读,直接回应高维时序的可读性。遗留缺口是每个样本要做优化,且性能高度依赖替换与评价;TIMING 用固定梯度积分避免 per-instance mask training/optimization。传递下来的设计是“连续时间结构应进入扰动”,但 TIMING 从优化 mask 转向随机片段路径。
11.3 TimeX++(Liu et al., ICML 2024)
TimeX++ 用信息瓶颈、解释提取器和 conditioner 生成 in-distribution、label-preserving 的 explanation-embedded instance,解决 mask signalling 与分布漂移。遗留缺口是需要学习额外模块,且论文表 2/3 显示其在 CPD 上很低。TIMING 不训练生成器,改由部分保留原序列让路径靠近输入。传递的设计是“解释评估的替换样本不能任意 OOD”,但 TIMING 只做启发式缓解,没有密度或判别器证据证明路径在分布内。
11.4 ContraLSP(Liu et al., 2024)
ContraLSP 以对比学习和稀疏 gate 提取局部显著点,在既有 Acc、Suff、Comp 上强。遗留缺口是 unsigned / zeroed negative importance 会漏掉压低预测的证据。TIMING 以绝对值排序并在 CPD/CPP 中逐步遮挡正负证据。传递的是“解释需要稀疏且局部”,但 TIMING 并不直接优化稀疏性。
┌─ 梯度公理线 ─ IG (2017) ───────────────┐
模型无关局部解释 ────────┤ ├─ TIMING (2025)
└─ 时序扰动线 ─ Dynamask (2021) ────────┤ ├─ CPD/CPP:逐步评价
├─ ContraLSP (2024) ──┤ └─ 连续片段随机路径
└─ TimeX++ (2024) ────┘
│
OOD / signalling / 方向抵消成为转折点
| 方法 | 是否训练额外解释器 | 时间结构 | signed | 主要保证 | TIMING 表 2 CPD50 |
|---|---|---|---|---|---|
| IG | 否 | 无 | 是 | Sensitivity、Implementation Invariance、Completeness | .342±.021 |
| Dynamask | 每样本优化 mask | 动态连续 mask | 通常无符号 | 稀疏 / legibility 目标 | .052±.002 |
| ContraLSP | 是 | 局部稀疏 gate | 主要无符号 | 对比与稀疏目标 | .013±.001 |
| TimeX++ | 是 | conditioner 生成时序 | 主要无符号 | 信息瓶颈近似与分布约束 | .027±.002 |
| TIMING | 否 | 随机连续片段路径 | 是 | Sensitivity、Implementation Invariance;不 complete | .366±.021 |
12. 论文自述限制
- 评价可被符号排序操纵。 §3.2(第 4 页)明确说 signed 方法若按绝对值顺序交替正负点,可能抬高 CPD/CPP,因此不应利用符号操纵排序。
- Completeness 丢失。 Proposition 4.4 与其后讨论(第 5–6 页)明确说明归因和不再等于输出差。
- 复现环境不一致。 官方 README 明示,公开训练脚本因与原训练环境不同,可能无法单独完全复现论文结果;MIMIC 模型检查点也因访问限制不公开。
论文没有独立的“Limitations”章节,也未报告用户研究、因果验证或部署测试。
13. 独立批判(证据 → 推论)
- [指标构念效度] 因为 CPD 是逐步输出变化的 L1
和,满足三角不等式
CPD ≥ ||F(x)-F(x↑K)||₁,路径来回摆动会重复累计,所以高 CPD 不必然等于更准确地识别净贡献,可能只是遮挡轨迹更曲折。 - [循环验证] 因为核心方法与主要胜出指标由同一论文共同提出,且在既有 Acc/CE/Comp 上 Extrmask 明显更强(表 2:Comp×100 23.370 对 0.436),所以不能用 CPD 全胜单独证明普遍解释质量更高;需要外部任务或独立 ground truth。
- [统计] 因为 Freezer Zero 仅从 IG .405±.111 到 .409±.109,差 0.004 远小于单个方法 SE,所以“六数据集一致提升”的点估计事实不能推出 Freezer 上可靠改善。
- [归因守恒] 因为 TIMING 明确不满足 completeness,所以不同样本或不同片段超参下归因总量未被固定,进而绝对归因大小的跨样本比较缺少 IG 原有的标尺。
- [OOD 证据缺失] 因为论文声称部分保留能缓解 OOD,却未报告路径样本的密度、判别器 AUC、最近邻距离或 calibration,所以“更 in-distribution”目前是合理机制假说,不是被直接验证的实验结论。
- [结构偏置] 因为随机片段一次只选一个通道,PAM 的 17 通道同步动作、Boiler 的 20 传感器耦合并未显式成组,所以方法可能把跨通道事件拆散;Boiler 的大幅增益也不能说明学到了物理耦合。
- [超参外推] 因为六数据集脚本使用不同
(n,s_min,s_max),而敏感性只在 MIMIC 的 T=48 上报告,所以无法推出对 T=600 的 PAM 或 T=301 的 Freezer 同样稳健。 - [复现性] 因为 README 明确警告训练脚本不能完整复现且不公开 MIMIC 检查点,所以最关键的医疗主表无法由无数据权限的第三方端到端验证;这限制了审计可达性。
14. 开放挑战:可操作的 head-to-head 实验空白
理论
- CPD vs 净位移 vs 单调路径 CPD: 固定同一 attribution ranking,构造输出往返但终点相同的合成模型,比较三种指标与已知 feature contribution 的 Kendall τ;检验 CPD 是否奖励振荡。
- 守恒版 TIMING vs 原 TIMING:
对随机路径归因做逐样本投影使总和等于
F(x)-F(x'),在 CPD、AUP/AUR、跨样本 calibration 上 head-to-head,判断 completeness 是否能无损恢复。 - 片段先验 vs 学习结构: 单通道连续片段、跨通道 group-lasso 片段、频域周期块三者在已知交互真值合成数据上比较 interaction recovery。
工程与应用
- 等前向/反向预算: TIMING、IG、GradSHAP、StartGrad、TimeX++ 固定 50 次模型调用与同一 GPU,报告吞吐、峰值显存、CPD、AUP/AUR和能耗;当前图 4 排除了训练型方法。
- 真实临床用户研究: 对 MIMIC 病例盲测 TIMING、IG、Extrmask,让重症医师判断证据方向、定位错误和处置建议;主要终点是错误发现率与用时,不使用作者自定义指标。
- 替换器鲁棒性: 零、均值、条件扩散 imputer、最近邻真实片段四种替换在所有方法上全交叉;若算法排序随替换器逆转,则报告 ranking stability 而非单点 SOTA。
新兴方向
- 在线风险变化: TIMING 与 DeltaSHAP 在连续预测差
F(x_t)-F(x_{t-1})上比较;检验解释静态风险与解释风险变化是否需要不同 Shapley/gradient 目标。 - 跨域解释: TIMING 时间片段路径与 Cross-domain IG 的频域路径在 EEG、振动信号上比较临床/物理语义;终点包含频带 ground truth、completeness 与人类识别率。
15. 近期工作雷达
- Optimal Information Retention / ORTE,ICML 2025:用条件互信息统一冗余与完整性,正面补 TIMING 缺少全局优化准则的问题;但它仍依赖 mask 学习与互信息近似。
- Start Smart / StartGrad,ICLR 2025:用梯度初始化 mask 优化,连接快速梯度法与高质量扰动法;适合作为等预算强基线。
- DeltaSHAP,2025-07-03 arXiv:解释在线患者风险的“变化”而非静态分数,方向性与实时性更贴近临床监控。
- Cross-domain Integrated Gradients,2025-05-19 arXiv:把 IG 推到频域、ICA 与分解域并保留 completeness;它提醒 TIMING 的“连续时间片段”不是唯一合理语义单元。
- TimeSAE,2026-01-14 arXiv:以稀疏解码器寻找可解释时间概念,将 point attribution 推向 concept-level;忠实度仍需与黑箱行为验证。
- Delta-XAI,OpenReview:试图统一预测演化解释;它延续 TIMING 对方向信息的关注,但需避免再造只利于自身的评价闭环。
16. 结论
TIMING 最值得读的部分不是“又一个时序归因器”,而是对评价协议的拆解:一次遮掉 top-K 确实会让正负证据相互抵消。方法上,连续片段随机路径是一种便宜、模型无关、可迁移的结构先验;六真实数据集 12/12 CPD 单元格领先,Boiler Zero 相对 IG +109.84%,且只把 MIMIC 推理从 IG 的 0.034 s/样本增加到 0.040 s/样本。
但严格结论必须收窄:TIMING 没有在所有既有指标上获胜,不保证 completeness,没有直接证明路径更 in-distribution,也没有用户或因果解释验证。最稳妥的定位是:它是“signed attribution 公平评价 + 结构化 IG 路径”的强基线与研究起点,而不是已完成临床可信解释闭环的方法。
脚注:候选池与报告索引已更新。报告数字均来自实际读取的 TIMING 论文 v1
PDF(19 页)、附录或官方代码/README;未能核实的项目均明确标注。Warm
Editorial 验证器以 0 error / 0 warning 通过;本机虽安装 Playwright,但
/usr/bin/chromium、/opt/pw-browsers 与
Playwright 缓存均无 Chromium 可执行文件(启动返回 executable
missing),故无法诚实完成浏览器截图。报告改以响应式断点、宽表滚动、主题
CSS/JS、SVG 键盘 tooltip
与静态结构检查作为替代,未声称完成真实浏览器视觉验收。
六个真实数据集:Zero 替换 CPD(TIMING vs IG)
TIMING 在六列点估计均领先;Boiler 差距最大,Freezer 几乎持平。纵轴为 CPD,越高越好。