[NeurIPS 2025] SurvHTE-Bench: 填补生存数据异质性效应评估的“最后一公里”

SurvHTE-Bench: A Benchmark for Heterogeneous Treatment Effect Estimation in Survival Analysis

总结
问题
方法
结果
摘要

本文推出了 SurvHTE-Bench,这是首个针对右删失(Right-censored)生存数据中异质性治疗效应(HTE)评估的全面基准测试集。该基准涵盖了 53 种估计方法,并在合成、半合成及真实世界数据集(如 Twins 和 HIV 临床试验)上对 Causal Survival Forests 和生存 Meta-learners 等 SOTA 模型进行了严谨对比。

TL;DR

在精准医疗和个性化决策中,估算个体层面的治疗效应(CATE)至关重要。然而,面对带有“右删失”标签的生存数据,研究者往往陷入评估标准混乱的泥潭。本文推出了 SurvHTE-Bench,通过 40 个合成数据集、10 个半合成数据集以及 2 个真实世界案例(Twins 和 HIV 临床试验),对 53 种方法进行了名为“压力测试”的系统性对决,揭示了生存 Meta-learners 在复杂场景下的卓越鲁棒性。

痛点深挖:为何生存数据的 HTE 这么难?

在因果推断的学术景观中,生存分析由于其独特的**右删失(Right-censoring)**特性,始终是一块硬骨头。

  1. 反事实不可见:这是因果推断的共性,但生存时间因观察周期的限制,经常只知道“在某个时间点尚未发生”,而非确切时间。
  2. 评估碎片化:现有的方法(如 Causal Survival Forests)往往在各自生成的模拟数据上号称 SOTA,但由于缺乏统一的基准,这些结论往往难以经受不同删失率、不同分布模型的考验。
  3. 假设违反(Assumption Violation):现实医疗场景中,忽略性(Ignorability)和正值性(Positivity)常遭破坏。目前缺乏能同时测试这些极端情况的公共基准。

方法论详解:三大家族的统一与博弈

作者将现有的 survival HTE 算法框架清晰地归纳为“三大家族”,并在 SurvHTE-Bench 中实现了它们的模块化复刻:

  1. 结果插补法 (Outcome Imputation):将删失数据通过 Pseudo-obs, Margin 或 IPCW-T 转化为完全观测数据,再套用经典的 Double-ML 或 Causal Forest。
  2. 直接生存因果法 (Direct-survival CATE):原生支持删失数据,如 Causal Survival Forests (CSF) 和基于平衡表征学习的 SurvITE。
  3. 生存元学习器 (Survival Meta-learners):将 S-learner, T-learner 等扩展到生存模型(如 DeepSurv, RSF)上。

核心架构图示

模型架构与基准设计 上图展示了合成数据集通过 8 种因果配置与 5 种生存分布(Cox, AFT, Poisson)交叉生成的逻辑,确保了基准的全面性。

实验与结果:生存模型何时胜出?

通过大规模对比,研究得出了一些极具启发性的结论:

  • 删失率是分水岭:当删失率较低(<30%)且符合随机分配时,Double-ML 配合 Margin 插补法往往能在 RMSE 上夺冠。
  • 高删失下的王者:随着删失率飙升至 70% 以上,S-Learner-Survival 和 Matching-Survival(尤其是基于 DeepSurv 底层的)展现出了极强的统治力。
  • 算法多样性的选择:Causal Survival Forests 在大多数情况下表现稳健,但在违反 Positivity(正值性) 假设时,其性能下降程度超过了 Meta-learners。

性能对比可视化

Borda 排名结果 图注:Borda Count 排名显示,基于 DeepSurv 的 S-Learner-Survival 在 RMSE 综合表现上排名第一,而传统的插补方法在复杂配置下掉队明显。

深度洞察:SurvHTE-Bench 的行业价值

SurvHTE-Bench 的出现,不仅是算法排名的刷新,更是对生存因果推断领域的一种“拨乱反正”。

  1. 可扩展性 (Extensibility):作者提供的开源框架允许研究者轻松插入新的 Base Learner(如最新的 Transformer 生存模型)。
  2. 现实主义转向:通过引入 Informative Censoring(患者因病情严重而中途退出,导致删失时间与生存时间相关),迫使模型面对真实的临床复杂性。
  3. 未来的路:尽管该基准非常全面,但目前暂未涵盖时间相关治疗(Time-varying treatments)模型,这将是未来该领域的核心战场。

总结:如果你正在进行精准医疗或是个性化用药策略的研究,SurvHTE-Bench 是检验你算法成色的“第一试金石”。


开源链接:SurvHTE-Bench GitHub

发现相似论文

试试这些示例

  • 查找最近一年内针对高删失比例生存数据提出改进的 Heterogeneous Treatment Effect (HTE) 预测模型或算法。
  • 哪篇论文最早提出了 Causal Survival Forests (CSF) 框架,本文在 SurvHTE-Bench 中对其进行了哪些维度的鲁棒性测试?
  • 有哪些最新的研究尝试将 SurvHTE-Bench 中的评估方法应用到多模态电子健康记录(EHR)或具有时间敏感性的精准医疗决策任务中?
目录
[NeurIPS 2025] SurvHTE-Bench: 填补生存数据异质性效应评估的“最后一公里”
1. TL;DR
2. 痛点深挖:为何生存数据的 HTE 这么难?
3. 方法论详解:三大家族的统一与博弈
3.1. 核心架构图示
4. 实验与结果:生存模型何时胜出?
4.1. 性能对比可视化
5. 深度洞察:SurvHTE-Bench 的行业价值