One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

📄 arXiv: 2608.26058v1 📥 PDF

作者: Xiaomi Embodied Intelligence Team, University of Macau, :, Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang, Longmei Jiang, Weixiang Liang, Ying Gong, Yong Pan, Ziping Zhao, Zhiyuan Chen, Yangwei You, Kun Ma, Qinyuan Liu, Hangjun Ye, Zhi-xin Yang

分类: cs.RO

发布日期: 2026-08-26

备注: Technical Report,Project page: https://public-bots.github.io/UCAG-P


💡 一句话要点

提出UCAG-P以解决异构体态操控中的数据不匹配问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 异构体态操控 视觉-语言-动作 几何动作空间 机器人学习 人机协作 统一策略 动作翻译器

📋 核心要点

  1. 核心问题:现有方法在处理异构体态数据时,无法有效实现统一的视觉-语言-动作策略,导致学习效率低下。
  2. 方法要点:UCAG-P通过相机中心的统一动作表述,将不同体态的数据对齐到共享的几何动作空间,提升了策略的通用性。
  3. 实验或效果:UCAG-P在多个基准测试中表现优异,LIBERO达98.3%,RoboTwin Easy和Hard分别为88.7%和89.2%,且无需特定微调。

📝 摘要(中文)

现有的通用视觉-语言-动作(VLA)策略在面对异构体态数据时,受到机器人形态、相机配置和低级动作空间的固有差异的严重制约。现有方法通常通过显式的动作重定向、人机视频合成或特定数据集的适配分支来解决这一不匹配问题,限制了统一策略的联合学习。本文提出了UCAG-P,一种以相机为中心的统一动作表述,结构性地将异构体态数据集对齐到共享的几何动作空间。UCAG-P通过相机可观察的锚点运动在图像和相机坐标中表示操控,将机器人手臂、人形机器人和人手视为共同动作模式的不同体现。该方法在4.03K小时的机器人和仿真数据及2.34K小时的人类演示上进行训练,取得了显著的性能提升。

🔬 方法详解

问题定义:本文旨在解决异构体态操控中数据不匹配的问题。现有方法通常依赖于显式的动作重定向或特定数据集的适配,限制了统一策略的有效学习。

核心思路:UCAG-P通过相机可观察的锚点运动在图像和相机坐标中表示操控,避免了将机器人特定命令作为共享策略目标的做法。这种设计使得不同体态的操控能够在同一几何动作空间中进行学习。

技术框架:UCAG-P的整体架构包括一个几何条件的动作翻译器,该翻译器结合预测的运动与目标体态的运动学,生成可执行的控制指令。该架构允许共享的VLA策略学习可转移的操控几何,同时保留特定体态的可控性。

关键创新:UCAG-P的核心创新在于其结构性对齐异构数据集的能力,通过相机中心的动作表述实现了不同体态的统一学习。这与现有方法的显式重定向或适配策略形成了本质区别。

关键设计:在训练过程中,UCAG-P使用了4.03K小时的机器人和仿真数据以及2.34K小时的人类演示,采用了特定的损失函数和网络结构,以确保模型能够有效学习不同体态下的操控几何。具体的参数设置和网络架构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

UCAG-P在多个基准测试中表现出色,LIBERO达到了98.3%的准确率,RoboTwin Easy和Hard分别为88.7%和89.2%。此外,在LIBERO-Plus上实现了82.0%的零-shot性能,RoboCasa GR-1上达到62.0%,且均无需针对特定基准进行微调,展现了其强大的通用性。

🎯 应用场景

该研究的潜在应用领域包括机器人操控、智能家居、自动化生产等场景。通过实现统一的操控策略,UCAG-P能够在多种机器人平台上进行高效的任务执行,提升人机协作的灵活性和效率。未来,该方法有望推动更广泛的智能体在复杂环境中的自主操作能力。

📄 摘要(原文)

Scaling generalist vision-language-action (VLA) policies is severely bottlenecked by the inherent heterogeneity of embodied data, which spans diverse robot morphologies, camera configurations, and low-level action spaces. Existing paradigms typically address this mismatch through explicit action retargeting, human-to-robot video synthesis, or dataset-specific adaptation branches, fundamentally hindering the joint learning of a unified policy. We introduce UCAG-P, a camera-centric unified action formulation that structurally aligns heterogeneous embodied datasets into a shared geometric action space. Rather than treating robot-specific commands as the shared policy target, UCAG-P represents manipulation through camera-observable anchor motion in image and camera-frame coordinates, treating robot arms, humanoids, and human hands as different embodiments of a common action schema. A geometry-conditioned action translator combines predicted motion with target-embodiment kinematics to produce executable controls. The resulting decoupled architecture allows a shared VLA policy to learn transferable manipulation geometry while retaining embodiment-specific controllability. UCAG-P is trained on 4.03K hours of robot and simulation data and 2.34K hours of human demonstrations. A single checkpoint reaches 98.3% on LIBERO, 88.7% and 89.2% on RoboTwin Easy and Hard, 82.0% zero-shot on LIBERO-Plus, and 62.0% on RoboCasa GR-1, without benchmark-specific fine-tuning.