Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

📄 arXiv: 2608.02276v1 📥 PDF

作者: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

分类: cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出Harness-R1以实现可执行运行时的智能编辑

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 智能体 在线强化学习 动态编辑 运行时环境 任务成功率 协同进化 失败轨迹 可执行补丁

📋 核心要点

  1. 现有方法无法有效利用智能体在部署过程中积累的交互轨迹,导致智能体行为固定,缺乏灵活性。
  2. Harness-R1通过在线强化学习训练编辑器,使其能够根据失败情况动态调整运行时环境,优化任务成功率。
  3. 在WebShop、ALFWorld和DBBench等基准测试中,Harness-R1将Qwen3.5-9B的成功率从44.3%提升至53.6%,显示出显著的性能提升。

📝 摘要(中文)

在大型语言模型驱动的智能体部署过程中,智能体的行为通常保持固定,无法通过交互轨迹进行有效更新。本文提出Harness-R1,这是首个能够基于失败轨迹进行生命周期内编辑的学习方法。该方法通过在线强化学习训练专用的编辑器,使其优化编辑以提高任务成功率。实验结果表明,Harness-R1在多个基准测试中显著提升了智能体的成功率,展示了编辑器与目标智能体的协同进化潜力。

🔬 方法详解

问题定义:本文旨在解决智能体在部署过程中行为固定的问题,现有方法无法有效利用交互轨迹进行动态调整,导致智能体在面对失败时缺乏适应性。

核心思路:Harness-R1的核心思路是通过在线强化学习训练一个专用的编辑器,使其能够根据智能体的失败轨迹进行动态编辑,从而优化运行时环境以提高任务成功率。

技术框架:该方法包括两个主要模块:一是专用编辑器的在线训练,二是将失败轨迹转化为可执行补丁的工程师。编辑器通过冷启动的监督微调初始化,然后进行在线的群体相对策略优化。

关键创新:Harness-R1的最大创新在于将失败条件下的编辑能力转化为学习能力,实现了编辑器与目标智能体的协同进化,这是现有方法所不具备的。

关键设计:在技术细节上,编辑器的训练采用了在线强化学习,损失函数设计为优化任务成功率,网络结构则基于现有的强化学习框架进行调整,以适应动态编辑的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Harness-R1在WebShop、ALFWorld和DBBench等基准测试中,成功率从44.3%提升至53.6%,提升幅度达到9.3个百分点。经过针对目标智能体的微调后,成功率进一步提升至64.2%,显示出该方法的有效性和实用性。

🎯 应用场景

Harness-R1的研究成果在多个领域具有潜在应用价值,特别是在需要动态适应和优化的智能体系统中,如自动驾驶、机器人控制和智能助手等。通过提升智能体的灵活性和适应性,能够显著提高其在复杂环境中的表现,推动智能体技术的进一步发展。

📄 摘要(原文)

Agents built around large language models continually accumulate interaction trajectories during deployment, yet their behavior typically remains fixed. Beyond updating model weights, these trajectories can improve the agent harness that constructs context, mediates tools, validates actions, and recovers execution. We introduce Harness-R1, the first method, to our knowledge, that makes failure-conditioned, lifecycle-wide editing of an existing executable runtime a learned capability. It post-trains a dedicated harness engineer with online reinforcement learning so that its edits are optimized for the realized task success they produce, rather than proposed by a fixed editor. A separate 9B engineer converts batches of target-agent failures into validated executable patches; fresh same-batch reruns of the frozen target provide outcome rewards, so training updates only the engineer. Cold-start supervised fine-tuning initializes this editing policy, which is then trained online with group-relative policy optimization. Across WebShop, ALFWorld, and DBBench, Harness-R1 raises vanilla Qwen3.5-9B success from 44.3% to 53.6% (+9.3 percentage points). After direct target-agent fine-tuning, a target-specific engineer raises the average further from 59.2% to 64.2% (+5.0 points); because these gains hold both before and after fine-tuning the target, Harness-R1 points toward co-evolving the harness engineer and the target agent.