Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference

📄 arXiv: 2608.18982v1 📥 PDF

作者: Blazej Banaszewski, Andrew W. Fitzgibbon

分类: cs.LG, q-bio.BM, q-bio.QM

发布日期: 2026-08-19

备注: Preprint; Open source weights and code


💡 一句话要点

提出Monroe以解决生物测定活动预测中的数据限制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 分子基础模型 药物发现 生物测定 多任务学习 量子化学 数据限制 上下文预测 性能提升

📋 核心要点

  1. 现有的药物发现数据集依赖昂贵的实验,导致生物测定活动预测面临数据限制的挑战。
  2. Monroe通过在大规模分子数据集上预训练,改进图表示和多任务学习,提供了一种新的分子基础模型。
  3. 在Polaris基准测试中,Monroe的性能与现有MFM相当或更优,并在活动悬崖基准测试中显著提升。

📝 摘要(中文)

生物测定活动预测常因药物发现数据集依赖耗时且昂贵的实验而面临数据限制。为此,分子基础模型(MFM)应运而生,旨在将通用化学知识编码为分子表示,以便在数据受限的情况下实现良好的泛化。本文提出了Monroe,一个新的MFM,具有多项创新:在PM6量子化学数据集上对超过8100万分子进行预训练;改进的立体化学图表示;改进的训练损失,包括构象去噪和嵌入去相关;改进的多任务学习;以及用于下游上下文预测的先验数据拟合模型(TabPFN)。评估结果表明,Monroe在Polaris基准测试中表现优异,并在活动悬崖基准测试中显著超越了先前方法。最后,消融和迁移实验表明,基于PFN的下游预测器显著提升了MiniMol和CheMeleon这两个现有模型的性能,形成新的最优变体MiniMol_PFN和CheMeleon_PFN,表明我们的下游适应策略具有广泛的通用性。

🔬 方法详解

问题定义:本文旨在解决生物测定活动预测中的数据限制问题,现有方法往往依赖于昂贵的实验数据,导致模型泛化能力不足。

核心思路:Monroe的核心思想是通过大规模预训练和改进的分子表示,增强模型在数据稀缺情况下的泛化能力,利用多任务学习提升整体性能。

技术框架:Monroe的整体架构包括数据预处理、分子图表示、训练损失优化和下游预测模块。通过对分子进行图形化表示,结合多任务学习策略,提升模型的学习效率和准确性。

关键创新:Monroe的主要创新在于其大规模预训练能力、改进的立体化学图表示和新型的训练损失函数,这些创新使其在数据受限的情况下表现优异。

关键设计:在训练过程中,Monroe采用了构象去噪和嵌入去相关的损失函数,优化了多任务学习的策略,并引入了先验数据拟合模型(TabPFN)以增强下游预测的准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在实验中,Monroe在Polaris基准测试中与现有的分子基础模型相比表现相当或更优,并在活动悬崖基准测试中实现了显著的性能提升,表明其在分子发现中的有效性。通过消融实验,PFN基础的下游预测器显著提升了MiniMol和CheMeleon的性能,形成新的最优变体,展示了Monroe的广泛适用性。

🎯 应用场景

Monroe的研究成果在药物发现领域具有广泛的应用潜力,尤其是在需要快速筛选和评估化合物活性的场景中。通过提高模型的预测能力,Monroe能够加速新药的研发过程,降低实验成本,推动生物医药行业的发展。

📄 摘要(原文)

Bioassay activity prediction is often data-limited because drug-discovery datasets rely on time-consuming and expensive wet-lab experiments for data generation and evaluation. This challenge has inspired recent research into molecular foundation models (MFMs), which aim to encode general-purpose chemical knowledge into molecular representations that generalize well in data-constrained scenarios. This paper presents Monroe, a new MFM with several innovations over the existing state of the art: increased scale allowing pre-training on over 81 million molecules from the PM6 quantum chemistry dataset; improved graph representation of stereochemistry; improved training losses including conformer denoising and embedding decorrelation; improved multi-task learning; and the use of a prior-data-fitted model (TabPFN) for downstream in-context prediction. Our evaluations use a principled pairwise comparison framework that measures statistically significant performance differences. Across established Polaris benchmarks, Monroe matches or exceeds existing MFMs, while on activity cliff benchmarks, designed to assess utility for molecular discovery, it achieves significant improvements over prior methods. Finally, ablation and transfer experiments show that PFN-based downstream predictors also substantially improve two leading existing models, MiniMol and CheMeleon, yielding new state-of-the-art variants we call MiniMol_PFN and CheMeleon_PFN, suggesting that our downstream adaptation strategy generalizes beyond Monroe. Source code is at github.com/blazejba/monroe.