CrystalGRPO: Target-Aligned and Coverage-Preserving Reinforcement Learning for Flow-Based Crystal Structure Prediction

📄 arXiv: 2608.06582v1 📥 PDF

作者: Kaixiang Su, Hongfei Xue, Qiang Zhu

分类: cs.LG

发布日期: 2026-08-06


💡 一句话要点

提出CrystalGRPO以解决晶体结构预测中的目标对齐与覆盖问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 晶体结构预测 强化学习 生成模型 目标对齐 覆盖保持 材料科学 机器学习

📋 核心要点

  1. 现有流基生成模型在晶体结构预测中未能直接优化目标恢复,导致候选覆盖不足。
  2. CrystalGRPO框架通过结合MACE预测的能量与结构匹配评分,提供了更有效的目标对齐与覆盖保持策略。
  3. 实验结果显示,CrystalGRPO-Q在Top-1恢复上持续提升,而CrystalGRPO-C在Top-20恢复上表现更佳,均优于传统坐标强化学习方法。

📝 摘要(中文)

基于流的生成模型能够高效生成晶体结构预测(CSP)的候选结构,但其预训练目标并未直接优化下游目标恢复。强化学习后训练提供了一种灵活的解决方案,但现有方法主要依赖能量奖励和仅坐标的随机策略。预测的能量无法识别参考多晶型,而奖励驱动的浓度可能减少Top-N恢复所需的候选覆盖。本文提出了CrystalGRPO,一个CSP对齐的后训练框架,扩展了现有的ODE到SDE策略构建,结合了MACE预测的能量与基于结构匹配的恢复评分,并提供了两种操作模式:CrystalGRPO-Q优先单次抽样恢复,CrystalGRPO-C结合全轨迹参考正则化与覆盖感知的群体优势,以保持有限预算的目标恢复。在MP-20和MPTS-52数据集上,两个变体在所有四个骨干网络-数据集设置中均降低了一次和二十次样本的RMSE。

🔬 方法详解

问题定义:本文旨在解决流基生成模型在晶体结构预测中未能有效优化目标恢复的问题。现有方法主要依赖能量奖励和坐标随机策略,无法有效识别参考多晶型,导致候选覆盖不足。

核心思路:CrystalGRPO框架通过引入强化学习后训练,结合MACE预测的能量与结构匹配评分,优化了候选结构的生成过程,确保了目标对齐与覆盖的有效性。

技术框架:该框架包括两个主要模块:CrystalGRPO-Q和CrystalGRPO-C。前者优先考虑单次抽样恢复,后者则结合全轨迹参考正则化与覆盖感知的群体优势。

关键创新:CrystalGRPO的创新在于扩展了ODE到SDE的策略构建,能够同时处理坐标和晶格状态,从而提高了候选结构的质量和多样性。

关键设计:在设计上,CrystalGRPO采用了MACE预测的能量作为奖励信号,并引入了基于结构匹配的恢复评分,确保了在有限预算下的目标恢复效果。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,CrystalGRPO-Q在所有设置中均显著提高了Top-1恢复率,而CrystalGRPO-C在Top-20恢复上表现更佳。与传统坐标强化学习方法相比,两个变体在MP-20和MPTS-52数据集上均降低了一次和二十次样本的RMSE,显示出明显的性能提升。

🎯 应用场景

该研究在晶体材料设计、药物发现和新材料开发等领域具有广泛的应用潜力。通过提高晶体结构预测的准确性和效率,CrystalGRPO能够加速新材料的研发过程,推动相关领域的技术进步。

📄 摘要(原文)

Flow-based generative models can efficiently produce candidate structures for crystal structure prediction (CSP), but their pretrained objectives do not directly optimize downstream target recovery. Reinforcement-learning post-training offers a flexible solution, yet existing approaches rely primarily on energy rewards and coordinate-only stochastic policies. Predicted energy does not identify the reference polymorph, while reward-driven concentration can reduce the candidate coverage required for Top-N recovery. We introduce CrystalGRPO, a CSP-aligned post-training framework that extends existing ODE-to-SDE policy constructions to the joint coordinate--lattice state. CrystalGRPO combines MACE-predicted energy with a StructureMatcher-based recovery score and provides two operating modes: CrystalGRPO-Q, which prioritizes single-draw recovery, and CrystalGRPO-C, which combines full-trajectory reference regularization with a coverage-aware group advantage to preserve finite-budget target recovery. Across MP-20 and MPTS-52 with PXRDGen and OMatG backbones, both variants reduce one- and twenty-sample RMSE relative to coordinate-only reinforcement in all four backbone--dataset settings. CrystalGRPO-Q consistently improves Top-1, whereas CrystalGRPO-C achieves a higher Top-20 across all settings.