COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning
作者: Shrinidhi Kumbhar Santosh Mashetty Divij Handa Kevin Coutinho, Siddharth Sambhaji Ghule, Chitta Baral
分类: cs.CL
发布日期: 2026-08-31
备注: Accepted EMNLP 2026
💡 一句话要点
提出COGTRL以提升科学发现助手的认知能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 科学发现 认知痕迹 强化学习 人工智能 材料科学 模型优化
📋 核心要点
- 现有方法未能充分捕捉科学家在研究过程中所需的认知过程,导致LLMs的辅助效果不足。
- COGTRL通过强化学习训练LLMs生成认知痕迹,优化科学步骤与认知过程的联合表现。
- 在两个科学领域的实验中,COGTRL显著提升了方法质量,并获得专家的认可。
📝 摘要(中文)
大型语言模型(LLMs)在科学研究中的应用日益广泛,然而现有研究往往忽视了科学家在实现目标过程中所需的细致认知过程。本文提出COGTRL,一个基于轨迹的强化学习框架,旨在训练LLMs生成认知痕迹,从而提升其作为科学发现助手的表现。通过对两个3B参数模型在人工智能和材料科学领域的实验,COGTRL在方法质量上平均提升了7.85分,并在与70B参数模型的比较中表现出竞争力,专家分析显示COGTRL生成的方法更受青睐。
🔬 方法详解
问题定义:现有的LLMs在科学发现中的应用缺乏对科学家认知过程的模拟,导致其辅助效果不理想。现有方法主要依赖于文献训练,未能考虑约束、失败选择和迭代决策等细节。
核心思路:COGTRL的核心思路是通过强化学习训练LLMs生成认知痕迹,使其在科学发现中更具认知基础。通过联合优化认知痕迹和科学步骤,提升模型的推理能力。
技术框架:COGTRL的整体架构包括两个主要模块:认知痕迹生成模块和科学步骤优化模块。模型通过交替训练这两个模块,确保生成的步骤与认知过程相辅相成。
关键创新:COGTRL的主要创新在于其轨迹级强化学习框架,能够同时优化认知痕迹和科学步骤。这一方法与传统的单一文献训练方法有本质区别,强调了认知过程的重要性。
关键设计:在模型设计中,采用了特定的损失函数来平衡认知痕迹与科学步骤的优化。此外,模型的参数设置经过精细调整,以确保在不同科学领域的适应性和表现。
🖼️ 关键图片
📊 实验亮点
在实验中,COGTRL在两个3B参数模型上实现了平均7.85分的质量提升,相较于基线模型表现出显著优势。此外,COGTRL的表现与70B参数模型相当,显示出其在科学发现助手中的有效性和竞争力。
🎯 应用场景
COGTRL的研究成果具有广泛的应用潜力,尤其是在科学研究、工程设计和技术开发等领域。通过提升LLMs的认知能力,研究人员可以更高效地进行科学发现,推动技术创新与进步。未来,该方法可能在教育和培训中也发挥重要作用,帮助学生和研究人员更好地理解科学思维过程。
📄 摘要(原文)
Large Language Models (LLMs) trained on extensive scientific research are increasingly integrated as assistants for scientific discovery. However, most research papers omit the fine-grained cognitive process of examining constraints, failed alternatives, and iterative decisions required to achieve the desired goal. Such cognitive processes are vital for real-world scientists working toward specific goals under constraints. In this paper, we show that LLMs, when trained to produce such cognitive traces, perform better as scientific discovery assistants than when trained solely on scientific literature. We propose COGTRL, a trajectory-level reinforcement learning framework that trains LLMs to emulate cognitively grounded reasoning by jointly optimizing cognitive traces and the scientific steps produced in an interleaved manner. Across two 3B-parameter models and two scientific domains (AI and Materials Science), COGTRL improves method quality by an average of 7.85 points over comparable 3B model baselines and achieves competitive performance relative to 70B parameter models. Moreover, analysis by domain experts shows a preference for methods generated by COGTRL over the baselines.