LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

📄 arXiv: 2608.17393v1 📥 PDF

作者: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

分类: cs.AI

发布日期: 2026-08-18

备注: Webpage: https://lego-rl.pages.dev


💡 一句话要点

提出LEGO-RL以解决编码代理强化学习中的环境不一致问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 编码代理 策略梯度 环境一致性 模型优化 自动化编程 软件开发

📋 核心要点

  1. 现有的编码代理强化学习方法在环境崩溃和奖励黑客行为方面存在严重问题,导致训练信号不可靠。
  2. LEGO-RL框架通过进程内LLM代理、沙箱编排和集成插件,解决了环境与策略训练之间的不一致性。
  3. 在三个本地编码代理环境中,LEGO-RL显著提高了Qwen3.5-35B-A3B模型的性能,验证了其有效性。

📝 摘要(中文)

编码代理的强化学习越来越依赖于长时间运行的代理环境来管理工具集成、代码库上下文和执行反馈。然而,这些环境的本地执行与策略梯度训练之间存在固有的不一致性,导致环境崩溃和奖励黑客行为破坏了结果信号。为了解决这个问题,本文提出了LEGO-RL框架,它在不修改内部控制流的情况下,将本地编码代理环境与可扩展的策略梯度优化相结合。LEGO-RL的核心包括:通过进程内LLM代理实现真实优化、可扩展的沙箱编排以确保可靠执行,以及集成插件以实现可观察的训练。实验表明,LEGO-RL在多个编码代理环境中显著提高了模型性能。

🔬 方法详解

问题定义:本文旨在解决编码代理强化学习中本地执行环境与策略梯度训练之间的不一致性,现有方法在环境崩溃和奖励黑客行为方面存在显著不足,导致训练信号的可靠性降低。

核心思路:LEGO-RL框架通过不修改内部控制流的方式,将本地编码代理环境与可扩展的策略梯度优化相结合,确保训练过程中的信号一致性和可靠性。

技术框架:LEGO-RL的整体架构包括三个主要模块:1) 进程内LLM代理用于捕获生成流并进行对齐;2) 可扩展的沙箱编排以确保执行的可靠性;3) 集成插件用于自动化验证和监控,提供实时用户界面以进行详细的轨迹诊断。

关键创新:LEGO-RL的主要创新在于通过进程内代理实现真实的优化过程,并通过沙箱编排和监控插件解决了奖励黑客和环境崩溃的问题,这与现有方法的设计理念有本质区别。

关键设计:在设计中,LEGO-RL采用了基于令牌级对齐的优化策略,确保在环境压缩或重新序列化的情况下仍能保持训练信号的可靠性,同时设置了多阶段防御机制以减轻奖励黑客的影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,LEGO-RL显著提高了Qwen3.5-35B-A3B模型在多个编码代理环境中的性能:在OpenHands SDK中从64.0%提升至70.4%,在Claude Code中从62.4%提升至68.2%,在OpenCode中从57.2%提升至66.6%。同时,模型的回滚训练概率相关性保持在0.99以上,验证了其训练过程的稳定性。

🎯 应用场景

LEGO-RL框架的潜在应用场景包括自动化编程、智能代码生成和软件开发工具的优化。通过提高编码代理的训练效率和可靠性,该研究可以显著提升软件开发的自动化水平,降低开发成本,并推动智能编程助手的实际应用。未来,LEGO-RL可能在更广泛的AI应用中发挥重要作用,特别是在需要高可靠性和高效能的领域。

📄 摘要(原文)

Reinforcement learning for coding agents increasingly relies on long-running agent harnesses to manage tool integration, repository contexts, and execution feedback. However, the native execution environments of these harnesses are inherently misaligned with policy-gradient training: environmental crashes and reward hacking corrupt outcome signals, while train-inference discrepancies decouple rollout behavior from policy updates. To address this, we present LEGO-RL, a framework that bridges native coding-agent harnesses with scalable policy-gradient optimization without modifying their internal control flow. LEGO-RL is built upon three pillars: (1) faithful optimization via in-process LLM proxying that captures raw generation streams for token-level alignment and robust trainer-side log-probability recomputation, even under harness-side compaction or re-serialization; (2) reliable execution via scalable sandbox orchestration featuring image caching and stage-wise defenses to mitigate reward hacking; and (3) observable training through an integrated plugin that automates validation and monitoring, paired with a Live UI for granular trajectory diagnostics. We evaluate LEGO-RL by training the sparse MoE model Qwen3.5-35B-A3B with GSPO across three native coding-agent harnesses. LEGO-RL improves Qwen3.5-35B-A3B across OpenHands SDK (64.0% to 70.4%), Claude Code (62.4% to 68.2%), and OpenCode (57.2% to 66.6%) on SWE-bench Verified, while maintaining a rollout-training probability correlation above 0.99.