CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs
作者: Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su
分类: cs.RO, cs.AI, cs.LG
发布日期: 2026-08-03
💡 一句话要点
提出CoWAM以优化双手机器人策略的选择性干预
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 双手机器人 选择性干预 协调合同 世界行动模型 策略优化 机器人决策 人工智能
📋 核心要点
- 现有的世界行动模型虽然能预测未来,但在双手机器人策略中缺乏有效的干预机制,导致执行效率低下。
- CoWAM通过引入协调合同,结合可接受性检查和事件条件验证,实现了对双手策略的选择性干预,优化了决策过程。
- 在八个模拟任务中,CoWAM显著提高了协调有效选择和闭环成功率,展示了其在复杂任务中的应用潜力。
📝 摘要(中文)
世界行动模型(WAMs)通过基于动作的预测未来来增强机器人策略,但仅凭合理的未来预测并不足以改变双手策略的执行动作。本文提出了CoWAM,一个选择性干预层,通过协调合同表达同步、角色兼容性和碰撞收敛。每个合同结合了类型可接受性检查、事件条件验证和校准干预门。CoWAM在不满足所有活跃义务的情况下保持原始动作,只有在替代方案提供明确的低风险改进时才会进行干预。通过在八个模拟双手任务中的实验,CoWAM在协调有效选择上比仅使用合同的变体提高了16.7个百分点,并在闭环成功率上比最强选择基线提高了9.6个百分点,同时有害干预保持在1%以下。这些结果表明,协调合同是基于预测世界行动证据进行保守策略干预的有效接口。
🔬 方法详解
问题定义:本文旨在解决现有双手机器人策略在执行过程中缺乏有效干预机制的问题。现有方法仅依赖于未来预测,未能充分考虑动作的协调性和角色兼容性,导致执行效率低下。
核心思路:CoWAM的核心思想是通过协调合同来实现对双手策略的选择性干预。该方法确保在不满足所有活跃义务的情况下,原始动作保持不变,只有在替代方案提供明确的低风险改进时才会进行干预。
技术框架:CoWAM的整体架构包括多个模块:首先是类型可接受性检查,其次是事件条件验证,最后是校准干预门。这些模块共同作用,确保选择的干预措施是有效且安全的。
关键创新:CoWAM的主要创新在于引入了协调合同的概念,通过结合多种验证机制,提升了选择性干预的质量。这与传统方法的根本区别在于,传统方法往往忽视了动作之间的协调性。
关键设计:在设计上,CoWAM使用了统一的候选池进行选择,所有方法在共享的oracle标记之前做出决策。此外,关键参数如干预门的校准和可接受性检查的类型设置也经过精心设计,以确保干预的有效性和安全性。
🖼️ 关键图片
📊 实验亮点
在八个模拟双手任务中,CoWAM在协调有效选择上比仅使用合同的变体提高了16.7个百分点,并在闭环成功率上比最强选择基线提高了9.6个百分点,同时有害干预保持在1%以下,显示出其优越的性能。
🎯 应用场景
CoWAM的研究成果在双手机器人操作、协作机器人和人机交互等领域具有广泛的应用潜力。通过优化策略的选择性干预,该方法能够提升机器人在复杂环境中的执行效率和安全性,推动智能机器人技术的进一步发展。
📄 摘要(原文)
World Action Models (WAMs) augment robot policies with action-conditioned predicted futures, but a plausible future alone does not justify changing the action that a bimanual policy would execute. We present CoWAM, a selective intervention layer that expresses synchronization, role compatibility, and collision convergence as coordination contracts. Each contract combines typed admissibility checks with event-conditioned verification and calibrated intervention gates. CoWAM preserves the nominal action unless an alternative satisfies every active obligation and provides a clear, low-risk improvement; when the nominal action is also inadmissible, it invokes a predefined abstention fallback. To separate selector quality from proposal quality, all methods operate on identical candidate pools and commit their decisions before shared oracle labeling. Across eight simulated bimanual tasks, CoWAM improves coordination-valid selection by 16.7 percentage points over the contract-only variant and raises closed-loop success by 9.6 percentage points over the strongest selective baseline, while keeping harmful interventions below 1%. Together, these results establish coordination contracts as an effective interface for conservative policy intervention with predicted world-action evidence across coordination-rich bimanual tasks.