EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE
作者: Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang
分类: cs.CV, cs.AI
发布日期: 2026-07-30
备注: project page: https://egogenesis.github.io/
💡 一句话要点
提出EgoGenesis以解决稀缺的自我中心数据问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自我中心视频 机器人操作 数据合成 几何感知 视频生成 机器学习 具身AI
📋 核心要点
- 现有方法在自我中心视频数据收集上成本高昂,且难以获得多样化的场景和动作数据。
- EgoGenesis通过合成高质量的自我中心操作视频,利用几何感知机制来扩展训练数据集。
- 实验表明,合成数据显著提升了机器人在单臂和双臂任务上的成功率,验证了方法的有效性。
📝 摘要(中文)
自我中心视频为具身AI提供了丰富的操作体验,但在不同场景、物体、动作和具身性上收集多样化的自我中心数据仍然成本高昂。本文提出了EgoGenesis,一个自我中心世界-动作模拟器,能够合成可控的高质量操作视频,以扩展稀缺的真实世界训练数据。EgoGenesis基于预训练的视频生成模型,引入了两种几何感知的条件机制:在线锚定投影记忆(OAPM)和动作-3D旋转位置嵌入(A3D-RoPE),显著提高了视觉保真度、几何稳定性和动作对齐性。通过将400条真实轨迹与400条EgoGenesis生成的轨迹进行增强,单臂任务的成功率从77%提升至84%,双臂任务的成功率从53%提升至70%,证明了合成数据显著改善了下游世界-动作建模的泛化能力。
🔬 方法详解
问题定义:本文旨在解决自我中心视频数据稀缺的问题,现有方法在多样化场景和动作的收集上面临高成本和低效率的挑战。
核心思路:EgoGenesis通过合成可控的高质量操作视频,结合几何感知机制,增强了训练数据的多样性和质量,从而提高了机器人操作的泛化能力。
技术框架:EgoGenesis的整体架构包括两个主要模块:在线锚定投影记忆(OAPM)和动作-3D旋转位置嵌入(A3D-RoPE)。OAPM用于在自回归生成过程中保持3D场景锚点,而A3D-RoPE则通过编码末端效应器运动来增强动作几何信息。
关键创新:最重要的技术创新在于引入了OAPM和A3D-RoPE,这两者结合使得生成的视频在视觉质量、几何稳定性和动作对齐性上有了显著提升,与现有方法相比,能够更好地处理长时间的自我中心视频生成。
关键设计:在设计中,OAPM定期刷新最近状态以保持生成过程的连贯性,而A3D-RoPE则利用相机感知的3D旋转坐标来精确控制动作,这些设计细节确保了生成视频的高质量和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,通过将400条真实轨迹与400条EgoGenesis生成的轨迹结合,单臂任务的成功率从77%提升至84%,双臂任务的成功率从53%提升至70%。这一显著提升验证了合成数据在提高机器人操作成功率方面的有效性。
🎯 应用场景
EgoGenesis的研究成果在机器人操作、虚拟现实和增强现实等领域具有广泛的应用潜力。通过合成高质量的自我中心视频,能够为具身AI提供更丰富的训练数据,从而提升其在复杂环境中的操作能力和适应性,推动智能机器人技术的发展。
📄 摘要(原文)
Egocentric video offers rich manipulation experience for embodied AI, yet collecting diverse egocentric data across scenes, objects, motions, and embodiments remains costly. We present \method, an egocentric world-action simulator that synthesizes controllable, high-quality manipulation videos to expand scarce real-world training data. \method{} builds on a pretrained video generation prior and introduces two geometry-aware conditioning mechanisms. Online Anchored Projective Memory (OAPM) preserves a first-frame 3D scene anchor while periodically refreshing a recent state during autoregressive generation. Action-3D Rotary Position Embedding (A3D-RoPE) encodes end-effector motion with camera-aware 3D rotary coordinates, injecting action geometry into skeleton-to-video cross-attention for precise control. Together, these components improve visual fidelity, geometric stability, and action alignment in long egocentric rollouts. Moreover, augmenting 400 real trajectories with 400 \method-generated trajectories improves out-of-distribution real-robot success from 77\% to 84\% on single-arm tasks and from 53\% to 70\% on dual-arm tasks, demonstrating that the synthesized data substantially improve downstream WAM generalization.