From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents
作者: Xu Xia, Jinghua Piao, Min Yang, Xiaochong Lan, Jiaju Chen, Yong Li
分类: cs.AI
发布日期: 2026-07-30
💡 一句话要点
提出结果验证的比较自蒸馏方法以提升LLM代理能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自蒸馏 强化学习 能力内化 比较学习 智能代理 轨迹优化 结果验证 动态环境
📋 核心要点
- 现有的自蒸馏方法在监督学生时未能通过环境结果验证教师的偏好,导致学习效果受限。
- 本文提出的OVCSD方法通过结果验证的教师监督和比较学习,优化了学生和教师之间的学习过程。
- 实验结果显示,OVCSD在ALFWorld和WebShop上分别实现了29.7和5.4的绝对成功率提升,且训练期间增加的特权交互不足3%。
📝 摘要(中文)
近年来,LLM代理的研究正从外部能力引导转向能力内化,使代理能够在推理时保留有用的技能。尽管在线自蒸馏(OPSD)提供了一个有前景的方向,但现有方法通常通过对学生生成的轨迹进行评分来监督学生,这存在两个主要限制:教师偏好未通过环境结果验证,且动作级评分未充分利用学生和教师的滚动轨迹及其行为关系。因此,本文提出了结果验证的比较自蒸馏(OVCSD),通过组织失败的学生滚动轨迹为前缀树,适应性地从学生到达的状态调用技能条件教师,并仅保留结果验证的成功延续。实验表明,OVCSD在ALFWorld和WebShop上均优于无技能强化学习和现有自蒸馏基线。
🔬 方法详解
问题定义:本文旨在解决现有在线自蒸馏方法在教师偏好验证和信息利用方面的不足,尤其是通过环境结果来验证教师的决策。
核心思路:提出结果验证的比较自蒸馏(OVCSD),通过组织失败的学生轨迹并适应性调用教师,确保学习过程中的有效性和准确性。
技术框架:OVCSD的整体架构包括三个主要模块:轨迹组织模块、教师调用模块和比较学习模块。轨迹组织模块将失败的学生轨迹构建为前缀树,教师调用模块从学生状态中选择合适的教师,比较学习模块在状态对齐的分歧处进行学习。
关键创新:OVCSD的创新在于引入了结果验证的教师监督和比较学习机制,显著提高了学习效率和效果,与传统方法相比,能够更好地利用学生和教师的行为关系。
关键设计:在设计上,OVCSD采用了前缀树结构来组织轨迹,使用了特定的损失函数来优化教师与学生之间的学习关系,并在模型训练中控制特权交互的比例,确保训练的高效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,OVCSD在ALFWorld和WebShop上分别实现了29.7和5.4的绝对成功率提升,显著优于无技能强化学习和现有自蒸馏基线,展示了其在复杂任务中的有效性。同时,训练期间增加的特权交互不足3%,表明该方法在效率上的优势。
🎯 应用场景
该研究的潜在应用领域包括智能机器人、自动化决策系统和人机交互等。通过提升LLM代理的能力,OVCSD可以在复杂环境中实现更高效的任务执行,具有重要的实际价值和广泛的应用前景。未来,该方法可能推动更智能的自主系统的发展,提升其在动态环境中的适应能力。
📄 摘要(原文)
Recent work on LLM agents is shifting from external capability elicitation to capability internalization, enabling agents to retain useful skills without retrieval at inference time. On-policy self-distillation (OPSD) offers a promising direction, but many existing methods typically supervise students by scoring actions along student-generated trajectories. Such supervision has two limitations: teacher preferences are not validated by environment outcomes, and action-level scores underuse information from student rollouts, teacher rollouts, and their behavioral relationship. We therefore advocate outcome-verified teacher supervision and comparative learning over teacher-student trajectories. Based on this view, we propose Outcome-Verified Comparative Self-Distillation (OVCSD). OVCSD organizes failed student rollouts into a prefix tree, adaptively invokes a skill-conditioned teacher from student-reached states, and retains only outcome-verified successful continuations. It then applies localized comparative learning at the first state-aligned divergence and distills the post-divergence teacher suffix to transfer completion behavior. Experiments on ALFWorld and WebShop across three model scales show that OVCSD consistently outperforms skill-free RL and existing self-distillation baselines, achieving up to 29.7 and 5.4 absolute success-rate gains over the strongest baselines on ALFWorld and WebShop, respectively, while adding less than 3% privileged interaction during training.