[NeurIPS 2025] SurvHTE-Bench: 填补生存数据异质性效应评估的“最后一公里”
SurvHTE-Bench: A Benchmark for Heterogeneous Treatment Effect Estimation in Survival Analysis
本文推出了 SurvHTE-Bench,这是首个针对右删失(Right-censored)生存数据中异质性治疗效应(HTE)评估的全面基准测试集。该基准涵盖了 53 种估计方法,并在合成、半合成及真实世界数据集(如 Twins 和 HIV 临床试验)上对 Causal Survival Forests 和生存 Meta-learners 等 SOTA 模型进行了严谨对比。
TL;DR
在精准医疗和个性化决策中,估算个体层面的治疗效应(CATE)至关重要。然而,面对带有“右删失”标签的生存数据,研究者往往陷入评估标准混乱的泥潭。本文推出了 SurvHTE-Bench,通过 40 个合成数据集、10 个半合成数据集以及 2 个真实世界案例(Twins 和 HIV 临床试验),对 53 种方法进行了名为“压力测试”的系统性对决,揭示了生存 Meta-learners 在复杂场景下的卓越鲁棒性。
痛点深挖:为何生存数据的 HTE 这么难?
在因果推断的学术景观中,生存分析由于其独特的**右删失(Right-censoring)**特性,始终是一块硬骨头。
- 反事实不可见:这是因果推断的共性,但生存时间因观察周期的限制,经常只知道“在某个时间点尚未发生”,而非确切时间。
- 评估碎片化:现有的方法(如 Causal Survival Forests)往往在各自生成的模拟数据上号称 SOTA,但由于缺乏统一的基准,这些结论往往难以经受不同删失率、不同分布模型的考验。
- 假设违反(Assumption Violation):现实医疗场景中,忽略性(Ignorability)和正值性(Positivity)常遭破坏。目前缺乏能同时测试这些极端情况的公共基准。
方法论详解:三大家族的统一与博弈
作者将现有的 survival HTE 算法框架清晰地归纳为“三大家族”,并在 SurvHTE-Bench 中实现了它们的模块化复刻:
- 结果插补法 (Outcome Imputation):将删失数据通过 Pseudo-obs, Margin 或 IPCW-T 转化为完全观测数据,再套用经典的 Double-ML 或 Causal Forest。
- 直接生存因果法 (Direct-survival CATE):原生支持删失数据,如 Causal Survival Forests (CSF) 和基于平衡表征学习的 SurvITE。
- 生存元学习器 (Survival Meta-learners):将 S-learner, T-learner 等扩展到生存模型(如 DeepSurv, RSF)上。
核心架构图示
上图展示了合成数据集通过 8 种因果配置与 5 种生存分布(Cox, AFT, Poisson)交叉生成的逻辑,确保了基准的全面性。
实验与结果:生存模型何时胜出?
通过大规模对比,研究得出了一些极具启发性的结论:
- 删失率是分水岭:当删失率较低(<30%)且符合随机分配时,Double-ML 配合 Margin 插补法往往能在 RMSE 上夺冠。
- 高删失下的王者:随着删失率飙升至 70% 以上,S-Learner-Survival 和 Matching-Survival(尤其是基于 DeepSurv 底层的)展现出了极强的统治力。
- 算法多样性的选择:Causal Survival Forests 在大多数情况下表现稳健,但在违反 Positivity(正值性) 假设时,其性能下降程度超过了 Meta-learners。
性能对比可视化
图注:Borda Count 排名显示,基于 DeepSurv 的 S-Learner-Survival 在 RMSE 综合表现上排名第一,而传统的插补方法在复杂配置下掉队明显。
深度洞察:SurvHTE-Bench 的行业价值
SurvHTE-Bench 的出现,不仅是算法排名的刷新,更是对生存因果推断领域的一种“拨乱反正”。
- 可扩展性 (Extensibility):作者提供的开源框架允许研究者轻松插入新的 Base Learner(如最新的 Transformer 生存模型)。
- 现实主义转向:通过引入 Informative Censoring(患者因病情严重而中途退出,导致删失时间与生存时间相关),迫使模型面对真实的临床复杂性。
- 未来的路:尽管该基准非常全面,但目前暂未涵盖时间相关治疗(Time-varying treatments)模型,这将是未来该领域的核心战场。
总结:如果你正在进行精准医疗或是个性化用药策略的研究,SurvHTE-Bench 是检验你算法成色的“第一试金石”。
开源链接:SurvHTE-Bench GitHub
