分子性质预测新范式:表格基础模型实现“零微调”超越 SOTA
Tabular foundation models for in-context prediction of molecular properties
本文提出了一种结合表格基础模型(TFMs)与冻结分子基础模型嵌入的分子性质预测新范式。通过使用 TabPFN/TabICL 配合 CheMeleon 等高质量分子表示,该方法在不需要任务特定微调的情况下,在 Polaris 和 MoleculeACE 等 58 个基准任务及 11 个化工数据集上全面超越了现有的 SOTA 微调模型和经典机器学习方法。
TL;DR
在小样本到中型样本(low-to-medium data regime)的分子性质预测中,传统的微调方法不仅耗时且容易过拟合。RWTH Aachen 大学等机构的研究者证明,通过将分子的**冻结表示(Frozen Embeddings)输入到表格基础模型(Tabular Foundation Models, TFMs)中,利用原位学习(In-context Learning)**技术,可以在无需任何模型训练的情况下,在药物发现和化工数据集上获得超越微调深度学习模型的精度,并实现数十倍的加速。
背景定位:微调不是万能药
过去几年,分子基础模型(Foundation Models)如 CheMeleon、MolFormer 大行其道,它们通常在海量无标签 SMILES 数据上预训练,然后针对特定属性进行微调。然而,在实际化工或制药场景中,我们往往只有几百个实验测得的数据点。此时:
- 微调(Fine-tuning):如同在大象身上绣花,极其容易产生严重的过拟合。
- 经典 ML:随机森林(RF)或 XGBoost 虽然稳健,但无法充分释放基础模型学到的高维表征潜力。
本文引入了 TabPFN 和 TabICL,这种原本为通用表格预测设计的 Transformer 模型,彻底改变了游戏规则。
核心直觉:表格模型的“因果直觉”
为什么一个在合成数学函数上训练的表格模型(TFM)能预测分子的溶解度或燃油指标?
作者认为,TFMs 在预训练阶段已经通过大量的合成数据掌握了处理特征间统计依赖关系的“通用推理能力”。当我们将分子看作具有特定维度(如 RDKit2d 的 2048 维)的表格行时,TFMs 的 Attention 机制可以在推理时动态地将测试分子与训练集分子进行比对,实现贝叶斯后验推理的摊销(Amortization),这种能力比梯度下降更适合处理小样本数据。
方法论详解:两阶段解耦架构
该方法将预测流程解耦为高度独立的两个阶段:
- 特征提取(Featurization):直接使用预训练好的模型(如 CheMeleon)获取分子的 Frozen FP。
- 原位预测(In-context Inference):将标记好的训练集和未标记的测试点作为一个整体输入给 TFM。
注:上图展示了从 SMILES 字符串到不同分子表示(Descriptor/Embedding),再到进入 TabPFN 进行 In-context 预测的全流程。
实验与结果:全线碾压
1. 药物研究基准 (Polaris & MoleculeACE)
在极具挑战的 MoleculeACE(专注于微小的结构变化导致活性剧变的“活性悬崖”问题)中,TabPFN 配合 CheMeleon 嵌入在 30 个任务中全部获胜,平均排名仅为 2.10,显著优于微调后的 CheMeleon(秩次 7.53)。
2. 化学工程实际应用
在化工领域,燃料的十六烷值(DCN)、聚合物的带隙(Band Gap)等任务上,该方法即便不经过超参数搜索,表现也优于高度定制化的 GNN 或经过繁琐调优的 CatBoost。
注:帕累托前沿图清晰地显示,TabPFN-Mordred/RDKit2d 在预测误差最低的同时,推理能耗远低于微调模型。
3. 时间效率对比
- GPU 加速:相比微调 CheMeleon,TabPFN 的推理速度快了 18-46 倍。
- 部署难度:无需编写训练 Loop,无需调优学习率,仅需一次特征转换。
深度洞察:表示质量决定天花板
论文提出了一个反直觉的发现:与此前认为 TFM 对特征类型不敏感的观点不同,分子表示的选择是性能的主要驱动力。
- 原生描述符(RDKit2d/Mordred):表现出奇地强,甚至在某些化工任务中胜于嵌入。
- 传统指纹(Morgan):在 TFM 框架下表现较差,说明稀疏的位向量并不完全契合当前 TFM 的归纳偏置。
总结与未来
本文证明了 “冻结大模型表征 + 通用表格预测器” 可能是小样本科学数据建模的最佳路径。这种方法极大地降低了化学家使用人工智能的门槛——你不再需要成为一名 ML 专家去微调 Transformer,你只需要一个好的特征提取器和一个预训练好的 TabPFN。
局限性: 尽管在中小规模数据上表现优异,但当数据规模突破 2 万(如 Brouwer 数据集)时,由于 Transformer 全局注意力机制的内存占用限制,该方法面临硬件瓶颈。未来的研究方向在于如何将 In-context Learning 扩展到更大规模的化学系统以及多组分混合物模型中。
本文主编点评:该工作深刻揭示了学术界对‘端到端‘的过度执着可能牺牲了稳健性,回归 decoupled 架构在特定工业场景中更具实用价值。
