Cross-Embodiment Transfer via Behavior-Aligned Representations

📄 arXiv: 2607.27549v1 📥 PDF

作者: Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

分类: cs.RO, cs.AI, cs.CV, cs.LG

发布日期: 2026-07-30

备注: Project page: https://ajaysridhar.com/barx/


💡 一句话要点

通过行为对齐表示促进跨体态转移

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨体态转移 行为对齐表示 视觉-语言-动作模型 机器人操作 模仿学习 仿真到现实 多模态融合

📋 核心要点

  1. 现有的跨体态转移方法在实现显著转移效果时仍面临挑战,尤其是在多样化的数据集上。
  2. 本文提出通过行为对齐表示来促进跨体态转移,强调这些表示在不同体态间的预测能力和不变性。
  3. 实验结果表明,末端执行器轨迹对转移效果尤为显著,且在较大数据集上表现更佳,提升了28%的任务完成率。

📝 摘要(中文)

近年来,机器人操作的大规模模仿学习取得了显著进展,主要依赖于跨多种机器人体态的数据集。然而,实现显著的跨体态转移仍然面临挑战。本文研究了在视觉-语言-动作模型中使用行为对齐表示(如物体边界框、语言动作、机器人运动的末端执行器轨迹)的作用,以促进跨体态转移。我们假设这些表示在跨体态间具有不变性,同时能够预测机器人动作,从而有助于统一大规模跨体态数据以增强转移效果。通过开发一个基于仿真的基准测试,我们评估了不同表示及其整合方式的有效性。结果表明,末端执行器轨迹对转移特别有利,且在较大的先前数据集上,表示的有效性更高,能够利用无动作数据。此外,我们还展示了这些表示能够增强仿真到现实的跨体态转移,提升了基于仿真数据预训练的真实机器人策略的任务完成进度28%。

🔬 方法详解

问题定义:本文要解决的问题是如何有效实现跨体态转移,现有方法在处理多样化体态数据时效果不佳,难以统一不同体态的特征。

核心思路:论文的核心思路是利用行为对齐表示,这些表示在不同体态间保持不变性,同时能够有效预测机器人动作,从而促进数据的统一和转移。

技术框架:整体架构包括数据收集、行为对齐表示的生成、模型训练和转移评估四个主要模块。通过仿真环境进行评估,确保不同体态间的有效转移。

关键创新:最重要的技术创新点在于提出了行为对齐表示的概念,并验证了其在跨体态转移中的有效性,特别是末端执行器轨迹的使用。与现有方法相比,强调了表示的预测能力和不变性。

关键设计:在设计中,采用了特定的损失函数来优化行为对齐表示的生成,并在网络结构中引入了多模态输入,以增强模型对不同体态的适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用行为对齐表示能够显著提升跨体态转移的效果,特别是末端执行器轨迹的应用,使得真实机器人策略在仿真数据预训练后,任务完成进度提高了28%。

🎯 应用场景

该研究的潜在应用场景包括机器人操作、自动化制造、智能家居等领域。通过提升跨体态转移的能力,能够使机器人在多种环境中更灵活地执行任务,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recent progress in large-scale imitation learning for robot manipulation has been driven by leveraging datasets across a wide range of robot embodiments. However, achieving significant cross-embodiment transfer is often still challenging. In this work, we study the role of using behavior-aligned representations (e.g., object bounding boxes, language motions, end-effector traces of robot motion) in vision-language-action (VLA) models to promote cross-embodiment transfer. We hypothesize that by possessing invariances across embodiments while being predictive of robot actions, these representations can help unify large-scale cross-embodiment data to enhance transfer. To assess our hypothesis, we develop a simulation-based benchmark designed to assess transfer with diverse cross-embodiment data to new embodiments. Using this benchmark, we compare different representations and ways of incorporating them. We identify that end-effector traces can be particularly beneficial for transfer, representations are generally more useful with larger prior datasets, and can be used to benefit from action-free data. We also demonstrate that they can enhance sim-to-real cross-embodiment transfer, improving task completion progress of real robot policies pre-trained on simulation data by 28%. We provide videos of our evaluations at our website: https://ajaysridhar.com/barx/.