Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

📄 arXiv: 2608.18940v1 📥 PDF

作者: Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

分类: cs.LG, cs.AI, cs.CE, cs.CL

发布日期: 2026-08-19


💡 一句话要点

提出Top-K提示以解决单步逆合成的多样性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 单步逆合成 化学语言模型 多样性预测 Top-K提示 数据集构建 模型微调 反应空间

📋 核心要点

  1. 现有的单步逆合成方法在处理多样性反应预测时存在局限,无法有效捕捉一对多的反应特性。
  2. 本文提出Top-K提示作为一种新的训练和推理方法,旨在增强模型对多样化反应的捕捉能力。
  3. 实验结果显示,C3LM模型在OOD URSA-expert-2026基准上取得了最先进的性能,验证了新方法的有效性。

📝 摘要(中文)

单步逆合成是计算机辅助合成规划的核心组成部分,但其固有的一对多特性在单一答案评估和基准测试中表现不佳。为此,本文引入了Top-K提示作为一种稳健的训练和推理范式,以更好地捕捉多样且合理的反应预测。我们编制了CREED-CCV-2+USPTO-XL,一个超大规模的数据集,包含约4560万条经过验证的反应,用于训练C3LM(化学约束一致语言模型)。通过结合基于ChemCensor的微调和新颖性导向的奖励,我们的模型在OOD URSA-expert-2026基准上达到了最先进的性能。进一步的反应独特性分析表明,LLMs与传统模型探索了互补的反应空间,激励了基于集成的逆合成系统。

🔬 方法详解

问题定义:单步逆合成的多样性反应预测在现有方法中未能得到有效捕捉,导致评估和基准测试的局限性。

核心思路:引入Top-K提示作为训练和推理的核心方法,旨在通过多样性增强模型的反应预测能力,克服传统单一答案的局限。

技术框架:整体架构包括数据集的构建、模型的训练与微调,主要模块包括CREED-CCV-2+USPTO-XL数据集、C3LM模型及其奖励机制。

关键创新:最重要的创新在于Top-K提示的引入,使得模型能够在训练过程中考虑多种可能的反应路径,从而提升了反应预测的多样性和合理性。

关键设计:在模型训练中,结合了基于ChemCensor的微调策略和新颖性导向的奖励机制,优化了损失函数和网络结构,以提高模型的性能和反应独特性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,C3LM模型在OOD URSA-expert-2026基准上达到了最先进的性能,相较于传统模型,反应预测的多样性显著提升,验证了Top-K提示的有效性。

🎯 应用场景

该研究的潜在应用领域包括药物发现、材料科学和化学合成规划等。通过提升逆合成的多样性和准确性,能够加速新化合物的设计与合成,具有重要的实际价值和未来影响。

📄 摘要(原文)

Single-step retrosynthesis is a central component of computer-aided synthesis planning, yet its intrinsically one-to-many nature is poorly captured by single-answer evaluation and benchmarking protocols. To address this, we introduce Top-K prompting as a robust training and inference paradigm to better capture diverse, plausible reaction predictions. We compile CREED-CCV-2+USPTO-XL, an ultra-large-scale dataset of ~45.6 million verified reactions to train the C3LM (Chemistry Constraint-Consistent Language Model). By integrating fine-tuning with ChemCensor-based and novelty-oriented rewards, our model achieves state-of-the-art performance on the OOD URSA-expert-2026 benchmark. Further analysis of reaction uniqueness shows that LLMs and conventional models explore complementary reaction spaces, motivating ensemble-based retrosynthesis systems. Overall, our results establish Top-K, plausibility-aware training as a practical new direction for robust future LLM-based synthesis planning.