Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
作者: Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein
分类: cs.AI, cs.CL, cs.LG
发布日期: 2026-08-03
备注: Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa
💡 一句话要点
提出指令条件探索以解决大语言模型的探索问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 指令条件探索 不对称强化学习 自蒸馏 大语言模型 探索策略
📋 核心要点
- 现有方法在大语言模型的探索过程中面临动作空间结构带来的独特挑战,导致探索效率低下。
- 本文提出指令条件探索(ICE),通过多样化的指令增强训练过程中的行为覆盖,促进模型探索。
- 实验结果表明,ICE结合不对称强化学习与自蒸馏目标,显著提升了模型在数学推理任务上的表现。
📝 摘要(中文)
后训练的大语言模型(LLMs)结合强化学习(RL)已成为提升模型能力的重要工具,但LLM的动作空间结构带来了与经典RL不同的挑战,影响了探索的引导。为此,本文提出了指令条件探索(ICE),在训练期间通过多种不同的指令补充任务提示,从而增加尝试的行为覆盖范围。为支持ICE,本文提出了不对称强化学习与自蒸馏(Asymmetric-RL/SD)结合的训练目标,以将探索到的行为转移到无条件的测试策略上。ICE结合Asymmetric-RL/SD目标在数学推理任务上,相较于使用DAPO训练,Qwen3-1.7B的held-out pass@1性能提升了5.0%,且在更长的8K上下文中效果依然显著。
🔬 方法详解
问题定义:本文旨在解决大语言模型在强化学习中因动作空间结构复杂而导致的探索不足问题。现有方法未能有效利用预训练模型的广泛知识,导致训练过程中经验多样性不足。
核心思路:提出指令条件探索(ICE),通过在训练中引入多种指令来丰富任务提示,从而增加模型尝试的行为多样性。这种设计旨在充分利用预训练模型的灵活性和知识,促进更有效的探索。
技术框架:整体架构包括两个主要模块:指令条件探索模块和不对称强化学习与自蒸馏模块。ICE模块负责生成多样化的训练指令,而不对称RL/SD模块则用于将探索到的行为转移到测试策略中。
关键创新:最重要的创新点在于结合了指令条件探索与不对称强化学习和自蒸馏的训练目标,这一方法在行为探索和知识转移方面具有显著优势,与传统的强化学习方法相比,能够更好地利用预训练模型的潜力。
关键设计:在训练过程中,ICE模块通过多种指令生成不同的任务提示,而不对称RL/SD模块则采用特定的损失函数来优化模型的行为转移,确保在无条件测试时仍能保持高效的性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ICE结合不对称强化学习与自蒸馏目标,显著提升了Qwen3-1.7B在数学推理任务上的held-out pass@1性能,提升幅度达到5.0%。该提升在更长的8K上下文中依然有效,表明方法的鲁棒性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能对话系统和自动化推理等。通过提升大语言模型的探索能力,能够在更复杂的任务中实现更高的性能,未来可能对智能助手、教育技术和科学研究等领域产生深远影响。
📄 摘要(原文)
Post-training Large Language Models (LLMs) with Reinforcement Learning (RL) has become an important tool for improving model capabilities, but the LLM action-space structure introduces challenges distinct from classical RL, with implications for inducing exploration. New methods are required that leverage the broad knowledge and flexibility of pre-trained LLMs to deliberately generate diverse experience at training time. We propose Instruction-Conditioned Exploration (ICE), which supplements task prompts during training with one of several distinct instructions, increasing the coverage of behaviours attempted. To facilitate ICE, we propose Asymmetric-RL/SD, a combined Reinforcement Learning and Self-Distillation training objective, to transfer explored behaviours to the unconditioned test-time policy. ICE with the Asymmetric-RL/SD objective improves Qwen3-1.7B held-out pass@1 performance at $4$K response length on mathematical reasoning tasks by $5.0\%$ relative to training with DAPO, with improvement persisting at a longer 8K context.