RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation
作者: Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu
分类: cs.RO
发布日期: 2026-08-04
💡 一句话要点
提出RoboReact以解决人形机器人技能获取成本高的问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 人形机器人 技能获取 视频生成 深度感知 全身控制 在线再定位 几何保留 灵巧操作
📋 核心要点
- 现有方法在获取人形机器人灵巧操作技能时,面临高昂的硬件成本和人工标注的挑战。
- RoboReact框架通过生成操作视频和深度感知重建,自动合成全身人形操作技能,降低了技能获取的成本。
- 实验结果表明,RoboReact在多样化物体配置中表现出良好的泛化能力,能够有效应对执行中的干扰。
📝 摘要(中文)
人形机器人在复杂人类环境中执行灵巧操作的潜力巨大,但获取多样化和可推广的技能成本高昂,主要源于硬件数据收集和人工标注的高费用。近年来,视频生成模型的进展为从视觉观察中合成丰富的操作经验提供了机会,但将这些想象行为转化为可执行的全身人形技能仍然未被充分探索。本文提出RoboReact框架,能够从单个自我中心RGB-D观察中自动合成全身人形操作技能。RoboReact生成人类操作视频,通过深度感知的3D重建提取几何保留的交互关键帧,并将其重新定向到高自由度的人形平台,同时保持手-物体交互几何。为弥合想象计划与物理执行之间的差距,RoboReact执行在线物体中心再定位,并利用视觉-语言模型引导的优化循环来适应几何不匹配和执行偏差。经过优化的技能通过全身控制器执行,实现协调的全身操作和灵巧交互。实验证明,RoboReact在多样化物体配置中具有良好的泛化能力,并能在不需要遥控或人类示范的情况下稳健地从执行干扰中恢复。
🔬 方法详解
问题定义:本论文旨在解决人形机器人在复杂环境中获取灵巧操作技能的高成本问题。现有方法依赖于昂贵的硬件数据收集和人工标注,限制了技能的多样性和可推广性。
核心思路:RoboReact通过生成自我中心的操作视频并提取关键帧,结合深度感知技术,自动合成全身人形操作技能,旨在实现技能的高效获取和执行。
技术框架:RoboReact的整体架构包括视频生成模块、3D重建模块、关键帧提取模块和全身控制器。首先生成操作视频,然后提取几何保留的关键帧,最后通过控制器执行技能。
关键创新:RoboReact的创新在于结合了视频生成模型和视觉-语言模型,通过在线物体中心再定位和优化循环,解决了想象计划与物理执行之间的差距。这种方法与传统的技能获取方式有本质区别。
关键设计:在设计中,RoboReact采用了深度感知的3D重建技术,确保交互几何的保留。此外,优化循环中使用的损失函数和网络结构经过精心设计,以适应几何不匹配和执行偏差。
🖼️ 关键图片
📊 实验亮点
实验结果显示,RoboReact在多样化物体配置中表现出良好的泛化能力,能够在执行干扰下稳健恢复,且无需遥控或人类示范。与基线方法相比,RoboReact在技能执行的准确性和灵活性上有显著提升,具体性能数据未提供。
🎯 应用场景
RoboReact的研究成果在多个领域具有潜在应用价值,包括服务机器人、工业自动化和人机协作等。通过降低技能获取成本,该框架能够加速人形机器人在复杂环境中的应用,提升其灵活性和适应能力,推动智能机器人技术的发展。
📄 摘要(原文)
Humanoid robots have the potential to perform dexterous manipulation in human environments, yet acquiring diverse and generalizable skills remains costly due to expensive hardware data collection and labor-intensive annotation. Recent advances in video generative models provide a promising opportunity to synthesize rich manipulation experiences from visual observations, but transferring such imagined behaviors into executable whole-body humanoid skills remains largely unexplored. In this work, we present RoboReact, a framework that automatically synthesizes whole-body humanoid manipulation skills from a single egocentric RGB-D observation. RoboReact generates human manipulation videos, extracts geometry-preserving interaction keyframes through depth-aware 3D reconstruction, and retargets them to high-DoF humanoid platforms while preserving hand-object interaction geometry. To bridge the gap between imagined plans and physical execution, RoboReact performs online object-centric re-grounding and leverages a vision-language model-guided refinement loop to adapt skills under geometric mismatch and execution deviations. The refined skills are executed through a whole-body controller, enabling coordinated whole-body manipulation and dexterous interaction. Experiments on real humanoid robots demonstrate that RoboReact generalizes across diverse object configurations and robustly recovers from execution disturbances without requiring teleoperation or human demonstrations. These results highlight the potential of combining generative models, vision-language reasoning, and closed-loop control for scalable humanoid skill acquisition.