APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering

📄 arXiv: 2609.02253v1 📥 PDF

作者: Jie Ding, Rui Sun, Xinyuan Zhang, Zeyu Zhang, Xin Liu

分类: cs.AI, cs.CL

发布日期: 2026-09-02


💡 一句话要点

提出APEx框架以解决深度研究代理的经验利用问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 深度研究代理 经验利用 程序技能 闭环架构 强化学习 技能蒸馏 多轮推理

📋 核心要点

  1. 现有方法在经验利用上存在不足,无法有效结合历史交互与策略适应,导致决策效率低下。
  2. APEx框架通过层次化的经验组织,将交互历史转化为可用于策略优化的程序技能,提升决策质量。
  3. 在7个基准测试中,APEx的表现超越了当前最强的模型,显示出显著的性能提升。

📝 摘要(中文)

深度研究代理通过外部工具增强大型语言模型,以回答复杂的长时间问题并进行多轮推理。学习以往经验对持续改进至关重要,但现有方法要么检索冗长的任务特定轨迹,增加决策负担,要么蒸馏的程序技能与下游策略适应脱节。我们提出APEx,一个层次化的经验利用框架,将交互历史组织为实例级轨迹记忆和类别级程序技能,并通过执行者、蒸馏器和规划者的闭环架构将其耦合。实验表明,APEx在7个基准测试中表现出色,超越GPT-5.4 14.7分,超越最强内存增强基线3.0分。

🔬 方法详解

问题定义:本论文旨在解决深度研究代理在多轮推理中如何有效利用历史经验的问题。现有方法往往依赖冗长的任务特定轨迹,导致决策过程复杂且低效。

核心思路:APEx框架通过将交互历史分为实例级轨迹记忆和类别级程序技能,利用闭环架构实现经验的有效利用与策略适应的耦合。这样的设计使得历史经验能够直接指导当前决策,提升了决策的灵活性与准确性。

技术框架:APEx的整体架构包括三个主要模块:执行者(Executor)、蒸馏器(Distiller)和规划者(Planner)。执行者负责执行任务,蒸馏器从历史经验中提取程序技能,而规划者则利用这些技能进行实时决策。整个过程通过三阶段交替的GRPO训练范式进行优化。

关键创新:APEx的核心创新在于其闭环架构和奖励引导的技能蒸馏机制,这与传统的固定提示生成方法有本质区别。通过这种方式,模型能够在测试时进行自我改进,避免策略漂移。

关键设计:在技术细节上,APEx采用了特定的损失函数来平衡技能蒸馏与策略适应,同时设计了适应性强的网络结构,以支持多轮推理和实时决策的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,APEx在7个基准测试中表现优异,超越了GPT-5.4模型14.7分,且比最强的内存增强基线提高了3.0分,显示出其在深度研究代理中的有效性和优越性。

🎯 应用场景

APEx框架在复杂问题解答、智能助手和自动化决策系统等领域具有广泛的应用潜力。通过有效利用历史经验,该框架能够提升系统的智能水平和用户体验,未来可能在教育、医疗和金融等行业产生深远影响。

📄 摘要(原文)

Deep research agents augment large language models with external tools to answer complex, long-horizon questions through multi-turn reasoning. Learning from prior experience is crucial for continual improvement, yet existing methods either retrieve verbose task-specific traces that burden decision-making, or distill procedural skills that remain decoupled from downstream policy adaptation. We propose APEx, a hierarchical experience utilization framework that organizes interaction history into instance-level trajectory memories and category-level procedural skills, and couples them through a closed-loop architecture of Executor, Distiller, and Planner. The three modules are optimized via a three-stage alternating GRPO training paradigm, enabling reward-guided skill distillation rather than fixed-prompt generation. At test time, distilled skills serve as procedural priors for online Planner adaptation through skill-guided test-time reinforcement learning, allowing ground-truth-free self-improvement with skill-alignment regularization to prevent policy drift. Experiments on 7 benchmarks demonstrate that APEx achieves state-of-the-art performance, surpassing GPT-5.4 by 14.7 points and the strongest memory-augmented baseline by 3.0 points.