CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

📄 arXiv: 2608.30147v1 📥 PDF

作者: Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

分类: cs.CL

发布日期: 2026-08-31

备注: Accepted to EMNLP 2026 (Main)


💡 一句话要点

提出CAST框架以解决长时间工具调用代理的可靠性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间任务 批评学习 策略优化 大型语言模型 动态环境

📋 核心要点

  1. 现有方法在长时间任务中难以确保代理的可靠性,尤其是在复杂的决策轨迹中,LLM难以解释错误动作的原因。
  2. CAST框架通过将稀疏的任务结果转化为动作级监督,利用批评学习和策略优化来提升代理的可靠性。
  3. 在动态工具调用基准上,CAST对Qwen3系列模型进行微调,在零售任务中提高了超过10%的通过率,并在远程医疗任务中额外提升了9%。

📝 摘要(中文)

大型语言模型(LLM)代理在长时间、交互式和状态保持的环境中越来越多地被部署。在这些环境中,单个错误动作可能导致不可逆的任务失败,因此必须在执行前进行拦截。现有方法在确保代理可靠性方面面临挑战,尤其是在复杂的任务轨迹中。本文提出了CAST,一个基于批评意识的训练框架,将稀疏的任务结果转化为动作级监督,以进行批评学习和策略优化。通过分析代理轨迹,CAST合成结构化的理由,解释在部分可观察性下动作的有效性。实验结果表明,CAST在多个领域中提高了代理的可靠性,尤其在零售和远程医疗任务中显著超越了现有基线。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在长时间任务中因单个错误动作导致的不可逆失败问题。现有方法在解释错误动作方面存在不足,尤其是在复杂的决策轨迹中,难以提供有效的监督。

核心思路:CAST框架的核心思路是将稀疏的任务结果转化为动作级的监督信息,通过批评学习来提升模型的决策能力。通过分析代理的轨迹,生成结构化的理由,帮助模型理解动作的有效性。

技术框架:CAST的整体架构包括两个主要模块:批评模型和策略优化模块。批评模型负责从代理轨迹中提取结构化理由,而策略优化模块则利用这些理由来改进代理的决策策略。

关键创新:CAST的主要创新在于其批评意识的训练方法,通过将稀疏的任务结果转化为丰富的监督信息,显著提升了代理在复杂环境中的可靠性。这与传统的优化方法形成鲜明对比,后者缺乏系统性地生成验证理由的能力。

关键设计:在CAST中,关键设计包括合理的损失函数设置,以确保批评模型能够有效学习到动作的有效性。此外,网络结构经过优化,以适应动态环境中的决策需求。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,CAST在零售任务中相较于GPT-OSS-120B提高了超过10%的通过率,并在远程医疗任务中实现了额外的9%提升。这些结果表明,批评意识训练显著增强了LLM代理在动态环境中的鲁棒性。

🎯 应用场景

CAST框架在长时间交互式任务中具有广泛的应用潜力,特别是在零售、远程医疗等领域。通过提升代理的可靠性,CAST能够有效减少因错误决策导致的任务失败,从而提高用户体验和系统效率。未来,该方法还可能扩展到其他需要高可靠性的智能系统中。

📄 摘要(原文)

Large language model (LLM) agents are increasingly deployed in long-horizon, interactive, and stateful environments. In these settings, a single wrong action, such as refunding the wrong purchase, can cause irreversible task failure and must be intercepted before execution. Such failures may not appear in every single run, but can emerge across repeated trials, making reliability across steps and trials critical. However, ensuring agentic reliability is challenging: even frontier LLMs struggle to explain why an action may be wrong, especially in long, intertwined trajectories governed by domain-specific policies. Much recent work relies on prompt-based critique agents, while optimization-based methods lack a systematic way to produce rich verification rationales for training. We address this gap with CAST, a critique-aware training framework that converts sparse task outcomes into action-level supervision for critique learning and policy optimization. CAST analyzes agent trajectories to synthesize structured rationales explaining action validity under partial observability. The resulting critique model is used to construct critique-aware training data for optimizing the policy model. Fine-tuning Qwen3-family models on dynamic tool-calling benchmarks, CAST improves reliability across domains, outperforming GPT-OSS-120B by over 10% pass^4 on Retail tasks and yielding an additional 9% improvement on Telehealth in an out-of-domain setting. These results demonstrate that critique-aware training improves the robustness of LLM agents in realistic dynamic environments.