IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents
作者: Bo Ren, Yirong Mao, Yi Yang, Wenhui Que
分类: cs.LG
发布日期: 2026-08-25
备注: 12 pages, 3 figures, 5 tables. Preprint
💡 一句话要点
提出影响感知策略优化以解决多轮服务代理中的信用分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多轮交互 信用分配 影响感知 策略优化 服务代理
📋 核心要点
- 现有方法在多轮交互中难以有效分配信用,无法明确哪些动作对最终结果产生了影响。
- 本文提出影响感知策略优化(IAPO),通过构建影响依赖图来优化代理的策略,从而更好地进行信用分配。
- 实验结果显示,IAPO在多个基准测试中表现优越,且在多轮功能调用性能上没有妥协。
📝 摘要(中文)
大型语言模型(LLM)代理通过与用户和外部工具的多轮交互,越来越多地解决长时间跨度的任务。在这些场景中,相关任务信息往往随着时间展开,而不是在初始提示中完全指定。服务代理的挑战尤为明显:用户可能会澄清或修订他们的目标,而工具的响应提供了后续决策所需的信息。因此,最终的奖励无法单独指示哪些动作对任务的解决做出了贡献。本文提出影响感知策略优化(IAPO),将每个回合表示为一个可训练代理动作的类型影响依赖图,用户和工具观察作为证据。IAPO将支持使用和失败使用结构转换为路由权重,重新分配相同的轨迹级优势。实验表明,IAPO在多个基准测试中优于多轮强化学习基线。
🔬 方法详解
问题定义:本文旨在解决多轮服务代理中的信用分配问题,现有方法依赖于比较证据或单独构建的学习信号,难以有效利用已完成的回合信息。
核心思路:IAPO通过将每个回合表示为影响依赖图,利用用户和工具的观察作为证据,优化代理的策略,从而实现更精准的信用分配。
技术框架:IAPO的整体架构包括影响依赖图的构建、路由权重的计算以及策略优化三个主要模块。影响依赖图记录了代理动作之间的信息流和错误流。
关键创新:IAPO的核心创新在于将支持使用和失败使用结构转化为路由权重,这一方法与现有的基于比较的信用分配方法本质上不同,能够更有效地利用回合信息。
关键设计:在设计上,IAPO采用了特定的损失函数来优化策略,并通过训练可调参数来实现影响依赖图的动态更新,确保代理能够适应不同的任务场景。
🖼️ 关键图片
📊 实验亮点
实验结果表明,IAPO在三个服务代理基准测试中超越了多轮强化学习基线,尤其在Qwen3-4B和Qwen3-8B模型上表现突出,提升幅度显著,且在多轮功能调用性能上保持稳定。
🎯 应用场景
该研究的潜在应用领域包括智能客服、虚拟助手和其他需要多轮交互的服务代理系统。通过改进信用分配,IAPO能够提升代理的决策质量和用户体验,未来可能在商业和服务行业产生深远影响。
📄 摘要(原文)
Large Language Model (LLM) agents increasingly solve long-horizon tasks through multi-turn interactions with users and external tools. In these settings, relevant task information often unfolds over time rather than being fully specified at the initial prompt. Service agents make this challenge especially concrete: users may clarify or revise their goals, while tool responses provide information needed for subsequent decisions. Thus, a final reward alone cannot indicate which actions contributed to resolving the task. Recent methods rely on comparative evidence from other trajectories or resampled continuations, or on separately constructed step-level learning signals, to refine credit. However, a completed rollout already records how information and errors flow between agent actions. We introduce Influence-Aware Policy Optimization (IAPO), which represents each rollout as a typed influence-dependency graph over trainable agent actions, with user and tool observations serving as evidence. IAPO converts support-use and failed-use structure into routing weights that redistribute the same trajectory-level advantage. Experiments with Qwen3-4B and Qwen3-8B demonstrate superior performance over multi-turn reinforcement learning (RL) baselines across three service-agent benchmarks: {τ^2}-Bench, UserBench, and AgentChangeBench. BFCL-v4 Multi-Turn further shows that these gains do not compromise multi-turn function-calling performance. This work advances the understanding of credit assignment in multi-turn user interactions and provides a principled approach to training service agents from sparse outcome feedback.