JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment
作者: JoyAI-RA Team
分类: cs.RO
发布日期: 2026-08-06
备注: Project Page: https://joyai-ra-05.github.io/
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出JoyAI-RA 0.5以解决机器人操作学习数据稀缺问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 机器人操作 多模态学习 强化学习 视觉语义 物理动态 数据对齐 人机协作
📋 核心要点
- 现有方法在机器人操作学习中面临数据稀缺和异构数据源之间的负迁移问题,导致知识共享困难。
- 论文提出的JoyAI-RA 0.5框架通过双重动作对齐,结合视觉语义与物理动态先验,提升了操作学习的效率。
- 在AgiBot基准测试中,JoyAI-RA在任务适应性和基础策略改进上表现优异,任务得分随着人类数据量增加而持续提升。
📝 摘要(中文)
机器人数据稀缺,因此通用策略需要从异构来源学习,包括人类自我中心视频、仿真和真实机器人,这些数据在监督和体现上存在差异,且动作标签缺失或相互不兼容。我们提出JoyAI-RA 0.5,一个通用的视觉-语言-世界-动作(VLWA)框架,通过双重动作对齐将物理世界动态先验与视觉语义结合,扩展操作学习。隐式动作对齐从视觉转变中推断潜在动作,使无动作的人类、仿真和机器人数据能够引导潜在动作条件的世界模型学习物理动态。显式对齐则通过规范动作表示和相机帧块相对末端执行器动作将可靠的人类和机器人轨迹固定在统一的物理动作空间。最终的强化学习阶段将高效的任务适应与基础策略改进相结合。在真实世界的AgiBot基准测试中,JoyAI-RA在已见任务和未见变体上表现出色,随着人类自我中心预训练数据量的增加,任务得分持续提升,显示出人类视频不仅是弱辅助源,而是操作能力扩展的主要轴心。
🔬 方法详解
问题定义:本论文旨在解决机器人操作学习中数据稀缺的问题,现有方法在处理来自不同来源(如人类视频、仿真和真实机器人)的异构数据时,常常导致负迁移和知识共享不足。
核心思路:论文提出的JoyAI-RA 0.5框架通过双重动作对齐,结合隐式和显式对齐策略,使得无动作标签的数据能够有效地指导机器人学习物理动态,从而提升操作学习的效果。
技术框架:整体架构包括隐式动作对齐模块、显式对齐模块和强化学习阶段。隐式对齐模块从视觉转变中推断潜在动作,而显式对齐模块则将人类和机器人轨迹映射到统一的物理动作空间。强化学习阶段则结合了任务适应性和基础策略的改进。
关键创新:最重要的技术创新在于双重动作对齐策略的引入,特别是隐式对齐的设计,使得无动作标签的数据能够有效参与到学习过程中,与现有方法相比,显著提升了数据的利用效率。
关键设计:在设计中,采用了规范动作表示和相机帧块相对末端执行器动作的方式来实现显式对齐,同时在强化学习阶段引入了高效的任务适应机制,以确保策略的持续改进。
🖼️ 关键图片
📊 实验亮点
在AgiBot基准测试中,JoyAI-RA在已见任务和未见变体上均表现出色,任务得分随着人类自我中心预训练数据的增加而持续提升,显示出在最大规模下仍未达到平台期,表明其在操作学习中的强大潜力。
🎯 应用场景
该研究的潜在应用领域包括机器人操作、自动化制造和人机协作等。通过将人类视频数据转化为可迁移的训练信号,JoyAI-RA 0.5能够在多种操作任务中提升机器人的学习能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Robot data is scarce, so generalist policies need to learn from heterogeneous sources, including human egocentric video, simulation, and real robots, which differ in supervision and embodiment, with action labels missing or mutually incompatible. Human egocentric data scale best but sit farthest from robot data, and naive pooling causes negative transfer rather than knowledge sharing. We propose JoyAI-RA 0.5, a generalist Vision-Language-World-Action (VLWA) framework that couples physical world-dynamics priors with visual semantics and scales manipulation learning across such data via dual action alignment. Implicit action alignment infers latent actions from visual transitions, enabling action-free human, simulation, and robot data to guide a latent-action-conditioned world model in learning physical dynamics. Explicit alignment grounds reliable human and robot trajectories in a unified physical action space through a canonical action representation and camera-frame chunk-relative end-effector actions. An inner-outer-loop reinforcement stage then pairs efficient task adaptation with foundation-policy improvement. On a real-world AgiBot benchmark, JoyAI-RA performs strongly on both seen tasks and unseen variations. The task score improves consistently as the volume of human egocentric pretraining data increases and shows no sign of plateauing at our largest scale. This suggests that abundant but weakly labeled human experience can be converted into a transferable training signal, making human video not merely a weak auxiliary source but a primary axis along which manipulation capability can be scaled. Project page can be found at https://joyai-ra-05.github.io/.