CAPO: Constraint-Aware Prompt Optimization for LLM Agents
作者: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao
分类: cs.CL, cs.AI
发布日期: 2026-08-17
💡 一句话要点
提出CAPO以优化大型语言模型的系统提示
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 提示优化 约束感知 自动化工具 任务性能提升
📋 核心要点
- 现有方法在满足大型语言模型的操作要求时面临挑战,尤其是在工具使用和安全性方面。
- CAPO通过结合基于池的重写和自适应约束加权,优化系统提示以满足明确的操作约束。
- 实验结果表明,CAPO在代理基准测试中表现出色,且DCAPO在不同领域中均能生成可行提示并提高任务准确性。
📝 摘要(中文)
大型语言模型(LLMs)越来越多地作为代理使用,依赖系统提示来使用工具和完成任务。这种部署带来了特定的操作要求,包括适当的工具使用、简洁的提示和解决方案路径,以及遵循安全和格式政策。然而,对于许多从业者而言,组装领域特定的监督数据以对模型进行后训练以满足这些要求是不可行的。我们提出了CAPO(约束感知提示优化),这是一种结合基于池的重写和自适应约束加权的原始-对偶方法,旨在在明确的操作约束下优化系统提示。在代理基准测试中,CAPO更可靠地达到经验上可行的操作点,同时提高任务性能。CAPO还超越了代理设置,在输出格式和安全/隐私约束的助手风格评估中取得了良好结果。我们进一步引入了DCAPO(动态训练CAPO),它通过基于池的GRPO训练一个反馈和对偶条件重写器,同时保持任务代理不变。在不同规模的任务代理中,DCAPO在每个评估领域都生成了可行的提示,并匹配或提高了评估基线的任务准确性。
🔬 方法详解
问题定义:论文旨在解决大型语言模型在实际应用中面临的操作约束问题,现有方法往往无法有效满足这些约束,导致性能不佳。
核心思路:CAPO通过引入约束感知的提示优化机制,结合基于池的重写和自适应约束加权,旨在在满足操作要求的同时提升模型的任务性能。
技术框架:CAPO的整体架构包括两个主要模块:一是基于池的重写模块,二是自适应约束加权模块。前者负责生成候选提示,后者则根据操作约束动态调整提示的权重。
关键创新:CAPO的核心创新在于其原始-对偶优化方法,能够在明确的操作约束下优化提示,这与传统方法的静态优化方式有本质区别。
关键设计:在设计中,CAPO采用了动态调整的损失函数,以适应不同的操作约束,并使用了多层次的网络结构来处理提示生成和优化过程。具体参数设置和网络结构细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CAPO在代理基准测试中显著提高了任务性能,达到了更可靠的操作点。DCAPO在不同规模的任务代理中均能生成可行的提示,并在多个领域中匹配或超越了现有基线的任务准确性,展示了其强大的适应性和有效性。
🎯 应用场景
CAPO的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高效工具使用和遵循安全政策的场景中,如智能助手、自动化客服和数据处理等。通过优化提示,CAPO可以显著提升大型语言模型在实际任务中的表现,推动相关技术的发展。
📄 摘要(原文)
Large language models (LLMs) are increasingly deployed as agents that rely on system prompts to use tools and complete tasks. Such deployments impose distinct operational requirements, including appropriate tool use, concise prompts and solution paths, and compliance with safety and formatting policies. For many practitioners, however, assembling domain-specific supervised data to post-train models to meet these requirements is infeasible. We introduce CAPO (Constraint-Aware Prompt Optimization), a primal-dual method that combines pool-based rewrites with adaptive constraint weighting to optimize system prompts under explicit operational constraints. Across agentic benchmarks, CAPO more reliably reaches empirically feasible operating points while improving task performance. CAPO also generalizes beyond agentic settings, achieving strong results on assistant-style evaluations with output-format and safety/privacy constraints. We further introduce DCAPO (Dynamically Trained CAPO), which trains a feedback- and dual-conditioned rewriter with pool-based GRPO while keeping the task agent frozen. Across task agents of different sizes, DCAPO produces a feasible prompt in every evaluated domain and matches or improves the task accuracy achieved by the evaluated baselines. A surrogate analysis characterizes how finite-pool and discrete-rewrite errors enter the inexact primal-dual procedure.