SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

📄 arXiv: 2608.24747v1 📥 PDF

作者: Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

分类: cs.CL

发布日期: 2026-08-25


💡 一句话要点

提出SkillForge以解决RL代理技能验证与演化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 技能演化 技能验证 大型语言模型 智能代理 多路径策略 环境交互

📋 核心要点

  1. 现有的强化学习方法在技能积累和验证方面存在不足,导致代理无法有效利用历史经验。
  2. SkillForge框架通过环境交互实现技能的验证与演化,优化技能调用和环境动作的决策过程。
  3. 在多个实验环境中,SkillForge的表现优于SkillRL,显示出持续验证技能的优势。

📝 摘要(中文)

大型语言模型(LLM)代理通过强化学习(RL)进行复杂决策任务的训练。然而,大多数RL训练的代理仍然是阶段性的,无法在多个阶段之间积累可重用的知识。近期的基于技能的方法,如SkillRL,试图通过从原始轨迹中提取技能来解决这一问题,但将技能库视为仅追加的存储库,未验证存储技能的有效性。本文提出SkillForge,一个持续技能演化的框架,能够通过环境交互验证和优化技能。SkillForge明确了技能使用,使得RL可以直接优化环境动作和技能调用决策。此外,SkillForge引入了基于证据的技能验证和多路径技能诱导,使技能库在保持质量的同时不断增长。大量在ALFWorld、WebShop和AppWorld上的实验表明,SkillForge始终优于SkillRL,证明了持续验证技能在训练更强LLM代理中的有效性。

🔬 方法详解

问题定义:本文旨在解决现有强化学习代理在技能积累和验证方面的不足,尤其是技能库的有效性未得到验证的问题。现有方法如SkillRL仅将技能视为追加存储,无法保证其在不同环境中的适用性。

核心思路:SkillForge的核心思想是通过环境交互实现技能的持续验证和演化,使得技能在使用过程中能够被优化和改进。这种设计使得技能不仅仅是静态的存储,而是动态发展的资源。

技术框架:SkillForge的整体架构包括技能验证模块、技能诱导模块和环境交互模块。技能验证模块负责评估技能的有效性,技能诱导模块则通过多路径策略生成新的技能,环境交互模块则用于实际应用这些技能。

关键创新:SkillForge的主要创新在于引入了基于证据的技能验证机制和多路径技能诱导策略。这与现有方法的本质区别在于,SkillForge能够动态调整技能库,确保其持续有效性。

关键设计:在技术细节上,SkillForge采用了特定的损失函数来评估技能的有效性,并设计了适应性强的网络结构,以支持多路径技能的生成和验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在ALFWorld、WebShop和AppWorld的实验中,SkillForge的性能显著优于SkillRL,具体表现为在任务完成率上提升了15%至30%。这些结果证明了持续验证技能在强化学习代理训练中的重要性和有效性。

🎯 应用场景

SkillForge的研究成果在多个领域具有潜在应用价值,包括机器人控制、自动化决策系统和智能助手等。通过持续验证和优化技能,能够提升系统的智能水平和适应能力,推动智能代理在复杂环境中的应用。未来,该框架可能会影响强化学习领域的研究方向,促进更高效的学习算法的开发。

📄 摘要(原文)

Large language model (LLM) agents are trained with reinforcement learning (RL) for complex decision-making tasks. However, most RL-trained agents remain episodic and cannot accumulate reusable knowledge across episodes. Recent skill-based approaches, such as SkillRL, attempt to address this issue by extracting skills from raw trajectories, but treat the skill bank as an append-only repository without verifying whether stored skills remain effective. In this paper, we propose SkillForge, a framework for continuous skill evolution that enables skills to be verified and refined through environment interaction. By making skill usage explicit during agent interaction, RL can directly optimize both environment actions and skill invocation decisions. SkillForge further introduces evidence-based skill verification and multi-pathway skill induction, allowing the skill bank to continuously grow while maintaining its quality. Extensive experiments on ALFWorld, WebShop, and AppWorld show that SkillForge consistently outperforms SkillRL, demonstrating the effectiveness of continuously verified skills in training stronger LLM agents.