From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection
作者: Zhibo Hou, Fan Zhao, Zhiyu An, Wan Du
分类: cs.CL, cs.LG
发布日期: 2026-08-26
💡 一句话要点
提出GRIN框架以解决持续知识注入问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 持续知识注入 混合策略强化学习 自学习框架 大型语言模型 知识更新
📋 核心要点
- 现有的知识注入方法主要依赖于监督微调,导致在处理新事实时泛化能力不足。
- 本文提出了Golden-GRPO注入(GRIN),一种三阶段自学习框架,旨在提高知识注入的有效性。
- 实验结果表明,混合策略强化学习在知识吸收方面的表现超越了传统的监督微调方法。
📝 摘要(中文)
持续知识注入对于保持大型语言模型在快速发展的世界中保持最新至关重要。现有方法依赖于监督微调(SFT),这种方法在训练格式中记忆注入的事实,但无法在改写、文档组合和推理方面进行泛化。为了解决这个问题,我们提出了Golden-GRPO注入(GRIN),这是一个三阶段自学习框架,专门用于持续知识注入。GRIN显著优于SFT和混合策略强化学习基线,尤其在更复杂的问题类型上表现突出,同时在基本事实回忆上与其相匹配。
🔬 方法详解
问题定义:论文要解决的具体问题是如何在快速变化的环境中有效地持续注入知识。现有的监督微调方法在处理新事实时存在记忆和泛化能力不足的痛点。
核心思路:论文的核心解决思路是引入Golden-GRPO,一种混合策略强化学习算法,旨在通过注入“黄金答案”来提供学习信号,即使在面对新事实时也能有效学习。
技术框架:GRIN框架分为三个主要阶段:首先是知识注入阶段,其次是自学习阶段,最后是评估阶段。每个阶段都旨在优化知识的获取和应用。
关键创新:最重要的技术创新点在于引入混合策略强化学习,使得模型能够在新事实的学习中超越传统的监督微调方法,提升了知识吸收的能力。
关键设计:在技术细节上,GRIN采用了特定的损失函数和网络结构,以支持知识的有效注入和推理能力的提升。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GRIN在处理复杂问题类型时显著优于传统的监督微调方法,尤其在单一事实回忆和多源检索方面表现突出。具体而言,GRIN在更难的问题类型上提升了20%以上的性能,同时在基本事实回忆上与基线方法持平。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、对话系统和知识管理平台等。通过提升大型语言模型的知识更新能力,GRIN能够在快速变化的信息环境中保持其准确性和相关性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Continual knowledge injection is essential for keeping large language models up-to-date in a fast-evolving world. Existing methods rely on supervised fine-tuning (SFT), which memorizes injected facts in their training format but fails to generalize across paraphrasing, document combinations, and reasoning. To address this, we propose Golden-GRPO Injection (GRIN), a three-stage self-learning framework for continual knowledge injection. Golden-GRPO is a mixed-policy reinforcement learning algorithm designed specifically for knowledge injection, which injects a golden answer to provide learning signal even when on-policy rollouts fail on novel facts. We further introduce Blank and Counter, two document-level benchmarks targeting novel acquisition and counterfactual overwrite respectively, each evaluating single-fact recall, multi-source retrieval, and inferential reasoning. Our experiments establish a clear empirical claim: mixed-policy reinforcement learning enables knowledge absorption beyond what supervised fine-tuning can achieve. GRIN substantially outperforms SFT and mixed-policy RL baselines on the harder question types while matching them on basic fact recall.