Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

📄 arXiv: 2608.09555v1 📥 PDF

作者: Tianjun Pan, Yuan Li, Hongda Wang, Linbo Jin, Mengfei Song, Lei Gao, Qiming Shi, Shaokang Fu, Jiarong Zhao, Chengyu Wang, Chengfu Huo

分类: cs.AI

发布日期: 2026-08-10

备注: 9 pages, 6 figures


💡 一句话要点

提出双向上下文自蒸馏框架以提升技能型LLM代理的强化学习效果

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 双向上下文 自蒸馏 强化学习 技能型代理 大型语言模型 任务特定技能 元技能指导

📋 核心要点

  1. 现有技能型代理的训练主要依赖于任务级奖励,难以有效捕捉策略对技能的利用能力。
  2. 本文提出BCSD框架,通过双向上下文自蒸馏方法,提升LLM代理对外部技能的利用效率。
  3. 在ALFWorld和WebShop的实验中,BCSD展现出优于其他方法的整体性能,验证了其有效性。

📝 摘要(中文)

外部自然语言技能为大型语言模型(LLM)代理提供了可重用和可编辑的指导,以解决复杂任务。然而,其有效性不仅依赖于技能质量,还取决于策略能否将提供的指导转化为适当的行动。现有方法主要集中在任务级奖励的强化学习目标上,监督有限,难以捕捉策略使用技能的微妙差异。为此,本文提出了双向上下文自蒸馏(BCSD)框架,将自蒸馏与强化学习相结合,训练LLM代理更有效地使用外部技能。BCSD通过两个互补的技能上下文视角评估每个轨迹,增强视角引入更高层次的元技能指导,而减少视角则突出任务特定技能。实验结果表明,BCSD在ALFWorld和WebShop上实现了最强的整体性能,验证了增强和减少上下文视角的互补贡献。

🔬 方法详解

问题定义:本文旨在解决现有技能型代理在强化学习中对外部技能利用能力不足的问题。现有方法主要依赖于任务级奖励,缺乏对策略使用技能的细致监督,导致效果不佳。

核心思路:BCSD框架结合自蒸馏与强化学习,通过双向上下文视角评估轨迹,增强视角提供高层次的元技能指导,而减少视角则聚焦于任务特定技能,从而提升代理的技能利用能力。

技术框架:BCSD的整体架构包括两个主要模块:增强视角和减少视角。增强视角负责引入更高层次的技能指导,而减少视角则通过剪枝一般性指导来强调任务特定技能。两个视角的信号在token级别上结合,以重新调整强化学习的优势。

关键创新:BCSD的核心创新在于引入双向上下文视角,区别于以往依赖单一特权上下文的自蒸馏方法。这种设计使得代理能够从不同层次的指导中受益,提升了技能的利用效率。

关键设计:在参数设置上,BCSD采用了特定的损失函数来平衡增强和减少视角的贡献,同时在网络结构上,设计了适应性强的模块以处理不同任务的技能需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,BCSD在ALFWorld和WebShop上实现了最强的整体性能,相较于基线方法,性能提升幅度达到XX%(具体数据未知),验证了双向上下文视角的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化客服和复杂任务的决策支持系统。通过提升LLM代理对外部技能的利用能力,能够更好地应对多样化的任务需求,具有显著的实际价值和未来影响。

📄 摘要(原文)

External natural-language skills provide large language model (LLM) agents with reusable and editable guidance for solving complex tasks. Yet their effectiveness depends not only on skill quality, but also on whether the policy can translate the provided guidance into appropriate actions. However, methods specifically designed to improve this skill-utilization ability remain largely underexplored. In practice, skill-based agents are commonly trained with reinforcement learning objectives centered on task-level rewards, which offer limited supervision and struggle to capture subtle differences in how effectively the policy uses the provided skills. We propose BCSD (Bidirectional Context Self-Distillation), a framework that combines self-distillation with reinforcement learning to train LLM agents to use external skills more effectively. Unlike prior self-distillation methods that rely on a single privileged context, BCSD evaluates each trajectory from two complementary skill-context views. The augmented view introduces higher-level Meta-Skill guidance, while the reduced view prunes general guidance to highlight task-specific skills. Their complementary token-level signals are combined to rescale the RL advantage. Experiments on ALFWorld and WebShop demonstrate that BCSD achieves the strongest overall performance across model scales, enabling agents to utilize external skills more effectively. Ablation studies further verify the complementary contributions of the augmented and reduced context views. Code will be released to ensure full reproducibility.