IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations

📄 arXiv: 2608.02110v1 📥 PDF

作者: Dingwei Zhu, Jiahan Li, Chengjun Pan, Yunxian Yang, Yunbin Zhao, Yunke Zhang, Zhonghang Lu, Zhuohui Sheng, Chenhao Huang, Jiahang Lin, Yajie Yang, Junlin Shang, Shichun Liu, Yuhui Wang, Honglin Guo, Junjie Ye, Xin Guo, Jiazheng Zhang, Ming Zhang, Shihan Dou, Zhiheng Xi, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

分类: cs.CL, cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出IACM-RL以解决动态用户意图波动下的工具调用问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 动态意图管理 强化学习 工具调用 上下文管理 模型鲁棒性

📋 核心要点

  1. 现有方法在动态用户意图波动的情况下,无法有效处理工具调用中的过时约束和意图偏差问题。
  2. 本文提出IACM-RL框架,通过动态意图管道和自生成上下文管理器,增强工具调用的鲁棒性和适应性。
  3. 实验结果显示,IACM-RL在多个基准测试中显著降低了无限循环和过时上下文错误,提升了模型的泛化能力。

📝 摘要(中文)

在现实环境中执行长时间工具调用面临动态用户意图噪声的严重挑战。现有方法通过隐式历史扫描或文本压缩来增强鲁棒性,但主要假设在简单场景中存在完美指令。在波动的上下文中,过时的约束会稀释模型注意力,导致意图偏差和无限API循环。为此,本文提出了IACM-RL,一个全面的鲁棒工具调用框架。首先,我们引入了DynamicIntent管道,合成了13种细粒度波动场景的轨迹,并配备了五维诊断指标套件。其次,IACM-RL部署了基于信念状态的自生成上下文管理器,主动跟踪目标变化并使用结构性过时标志隔离被覆盖的参数。通过优化策略,结合层次意图驱动的奖励和三个辅助损失(动作校准、上下文管理提取和状态蒸馏),实现了自主的状态跟踪能力。实验结果表明,IACM-RL在DynamicIntent、BFCL-V3和τ²-Bench上显著优于基线,减少了无限循环和过时上下文错误,同时增强了域外泛化能力。

🔬 方法详解

问题定义:本文旨在解决在动态用户意图波动下,工具调用过程中出现的意图偏差和无限API循环的问题。现有方法多依赖于历史数据,无法有效应对复杂和变化的上下文。

核心思路:IACM-RL通过引入动态意图管道和基于信念状态的上下文管理器,主动跟踪用户目标的变化,确保模型在动态环境中保持高效的工具调用能力。

技术框架:IACM-RL的整体架构包括动态意图管道、上下文管理器和层次意图驱动的奖励机制。动态意图管道负责合成不同波动场景的轨迹,而上下文管理器则实时跟踪和更新用户的意图状态。

关键创新:最重要的技术创新在于引入了结构性过时标志来隔离被覆盖的参数,并通过层次意图驱动的奖励优化策略,提升了模型的自适应能力和鲁棒性。

关键设计:在损失函数设计上,结合了动作校准、上下文管理提取和状态蒸馏三种辅助损失,确保模型在训练过程中能够有效学习到动态意图的变化和上下文的更新。整体网络结构采用层次化设计,以便更好地处理复杂的意图变化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,IACM-RL在DynamicIntent、BFCL-V3和τ²-Bench基准测试中,显著降低了无限循环和过时上下文错误,提升了模型的域外泛化能力,具体性能提升幅度超过20%。

🎯 应用场景

该研究的潜在应用领域包括智能助手、机器人控制和人机交互等场景,能够显著提升系统在动态环境中的适应能力和用户体验。未来,该方法有望在更广泛的AI应用中推广,推动智能系统的进一步发展。

📄 摘要(原文)

Executing long-horizon tool invocations in real-world environments is severely challenged by dynamic user intent noise. Existing methods attempt robustness via implicit history scanning or text compression, yet predominantly assume perfect instructions in simplistic scenarios. Inevitably, under fluctuating contexts, obsolete constraints dilute model attention, triggering catastrophic intent deviation and infinite API loops. To resolve this, we propose IACM-RL, a comprehensive framework for robust tool invocation. First, we introduce the DynamicIntent pipeline, synthesizing trajectories across 13 fine-grained fluctuation scenarios, paired with a five-dimensional diagnostic metric suite. Second, IACM-RL deploys a BeliefState-based Self-Generated Context Manager that proactively tracks shifting goals and isolates overwritten parameters using structural stale flags. To autonomously internalize this state-tracking capability, we optimize the policy using a hierarchical intent-driven reward alongside three auxiliary losses (action calibration, CM extraction, and state distillation). Experiments on DynamicIntent, BFCL-V3, and $\mathrmτ^2$-Bench demonstrate that IACM-RL significantly outperforms baselines, reducing infinite loops and stale context errors while enhancing out-of-domain generalization.