MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
作者: Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang
分类: cs.RO
发布日期: 2026-08-26
备注: ECCV 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出MA-VLA以解决多臂协作中的行为分配问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多臂协作 视觉-语言-动作 原子动作分配 组合泛化 智能机器人
📋 核心要点
- 现有的视觉-语言-动作模型在多臂协作中缺乏对手臂特定行为的明确分配机制,限制了其在新协作模式下的迁移能力。
- MA-VLA通过将合作行为分解为原子提示并分配给各个手臂,实现了明确的子目标规范和任务间的组合重用。
- 在模拟和现实世界评估中,MA-VLA在未见的协作模式下表现优异,相较于现有方法显著提升了泛化能力。
📝 摘要(中文)
多臂协作已成为具身操作中的核心能力。现有的视觉-语言-动作(VLA)模型通常将语言表示为单一的全局指令,缺乏为每个手臂分配和组合特定行为的明确机制。这种设计限制了模型在训练中未见的协作模式的迁移能力。本文提出MA-VLA,一个通过原子动作分配实现多臂协作的统一框架。MA-VLA将合作行为分解为中级原子提示,并将其分配给各个手臂,从而实现明确的子目标规范和任务间的组合重用。我们还引入了Arm Shuffle,通过对观察、状态和分配的原子提示进行训练时的排列,减少对固定执行角色的依赖,支持未见协调模式的重组。实验表明,MA-VLA在未见的协作模式下表现优异,显示出结构化的每臂原子动作分配为多臂具身系统的可扩展泛化提供了实用路径。
🔬 方法详解
问题定义:本文旨在解决多臂协作中的行为分配问题,现有方法通常将语言视为单一指令,缺乏对手臂特定行为的明确分配,导致在新协作模式下的迁移能力不足。
核心思路:MA-VLA的核心思想是将合作行为分解为中级原子提示,并将其分配给各个手臂,从而实现明确的子目标规范和任务间的组合重用。这种设计使得模型能够更灵活地适应未见的协作模式。
技术框架:MA-VLA的整体架构包括原子动作分配模块和Arm Shuffle模块。原子动作分配模块负责将分解的原子提示分配给各个手臂,而Arm Shuffle模块则在训练时对观察、状态和提示进行排列,以增强模型的泛化能力。
关键创新:MA-VLA的主要创新在于引入了原子动作分配机制和Arm Shuffle技术。这与现有方法的本质区别在于,MA-VLA能够实现角色无关的指令跟随,支持未见的协调模式重组。
关键设计:在模型设计中,采用了特定的损失函数来优化原子动作的分配效果,并通过多样化的训练数据增强模型的适应性。网络结构上,MA-VLA结合了视觉、语言和动作模块,以实现多模态信息的有效融合。
🖼️ 关键图片
📊 实验亮点
在实验中,MA-VLA在未见的协作模式下表现出色,相较于现有的最先进的视觉-语言-动作模型,其成功率显著提高,展示了结构化的每臂原子动作分配在多臂具身系统中的有效性。
🎯 应用场景
MA-VLA的研究成果在多个领域具有潜在应用价值,包括智能机器人、自动化制造和人机协作等。通过提升多臂协作的灵活性和适应性,该模型能够在复杂环境中实现更高效的操作,推动具身智能系统的发展。
📄 摘要(原文)
Multi-arm collaboration is becoming a core capability in embodied manipulation. Recent vision-language-action (VLA) models integrate perception, language, and control, but most represent language as a single global instruction and do not provide an explicit mechanism for assigning and composing arm-specific behaviors. This design limits transfer to collaboration patterns that differ from those observed during training. We present MA-VLA, a unified framework for multi-arm collaboration via atomic action assignment. MA-VLA decomposes cooperative behavior into mid-level atomic prompts and allocates them to individual arms, enabling explicit subgoal specification and compositional reuse across tasks. To reduce reliance on fixed execution roles, we introduce Arm Shuffle, a training-time permutation of the observation, state, and assigned atomic prompts for each arm. This permutation enforces role-agnostic instruction following and supports recomposition into unseen coordination patterns, which we term multi-arm compositional generalization. We also construct a benchmark in which test-time collaboration patterns are absent in training set. Across simulation and real-world evaluations, prior state-of-the-art VLAs largely fail under these unseen collaborations, while MA-VLA consistently succeeds. These results indicate that structured, per-arm atomic action assignment offers a practical route to scalable generalization in multi-arm embodied systems. Code, models, and data are available at https://github.com/zhangzaibin/future-robots