An Agentic Retrobiosynthesis Framework with Learned Frontier Selection
作者: Philippe Meyer, Guillaume Gricourt, Thomas Duigou, Joan Hérisson, Jean-Loup Faulon
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-08-31
💡 一句话要点
提出基于学习的边界选择框架以优化反向生物合成
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 反向生物合成 边界选择 大型语言模型 生化引擎 搜索策略 微调模型 药物开发 代谢工程
📋 核心要点
- 现有的反向合成方法在搜索策略与反应模型的独立贡献上存在不确定性,影响了合成效率。
- 本文提出了一种基于学习的边界选择框架,利用微调的Qwen2.5-7B模型优化反向生物合成过程中的搜索策略。
- 实验结果表明,微调策略在多个基准测试中均优于传统方法,解决率显著提高,展示了边界选择的有效性。
📝 摘要(中文)
随着大型语言模型在多步骤反向合成中的应用日益增加,本文探讨了其搜索策略在反向生物合成中的独立贡献。通过基于规则的反向生物合成,研究使用确定性生化引擎生成相同的验证过的转化,聚焦于如何选择下一个扩展的边界分子。经过微调的Qwen2.5-7B策略在多个基准测试中表现优异,显示出边界选择的监督可以在不改变生化生成的情况下提升预算搜索的效率。尽管性能仍依赖于边界构建和反应排名,微调策略的表现始终优于直接提示。
🔬 方法详解
问题定义:本文旨在解决现有反向生物合成方法中搜索策略与反应模型独立贡献的评估问题,现有方法在效率和准确性上存在不足。
核心思路:通过引入基于学习的边界选择策略,优化搜索过程中的分子扩展选择,从而提高反向生物合成的成功率和效率。
技术框架:整体架构包括一个确定性的生化引擎用于生成转化路径,以及一个微调的Qwen2.5-7B模型用于选择下一个扩展的边界分子,形成一个闭环的优化过程。
关键创新:最重要的创新在于通过学习优化边界选择,而非依赖传统的反应模型,从而在不改变生化生成的情况下提升搜索效率。
关键设计:在模型微调过程中,采用严格的选择接口,并通过不同的扩展次数进行性能评估,确保策略的有效性和鲁棒性。实验中使用的损失函数和参数设置经过精心设计,以适应生化反应的特点。
🖼️ 关键图片
📊 实验亮点
实验结果显示,微调后的策略在10次扩展时的解决率达到65±1%,在200次扩展时达到78±1%,相比于传统的MCTS方法有显著提升,展示了边界选择的有效性和重要性。
🎯 应用场景
该研究的潜在应用领域包括生物合成、药物开发和代谢工程等。通过优化反向生物合成的搜索策略,能够加速新药物的发现和生物产品的合成,具有重要的实际价值和广泛的未来影响。
📄 摘要(原文)
Large language models are increasingly used as agents for multistep retrosynthesis, raising the question of how much their search policy contributes independently of the underlying reaction model. We investigate this question in a biological setting through rule-based retrobiosynthesis: a deterministic biochemical engine generates the same validated transitions for every method, searching for routes that terminate in metabolites available to an \emph{Escherichia coli} chassis, while the policy only selects which frontier molecule to expand next. Prompted and LoRA-tuned Qwen2.5-7B policies use a strict choice-only interface. The fine-tuned policy reaches $65\pm1$\% solve rate at 10 expansions on LASER versus 59\% for MCTS, and at 200 expansions reaches $78\pm1$\% versus 75\% on LASER, $88\pm3$\% versus 80\% on the RetroPath RL Golden benchmark, and $63\pm2$\% versus 45\% on the BioNavi-NP benchmark. Fine-tuning also consistently outperforms direct prompting. These results show that route-supervised frontier selection can improve budgeted search without altering biochemical generation, although performance remains dependent on frontier construction and reaction ranking.