NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation
作者: Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang
分类: cs.CV
发布日期: 2026-08-25
💡 一句话要点
提出NeoWorld-Pro以解决单目图像到交互场景构建问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱四:生成式动作 (Generative Motion) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 单目图像重建 交互式3D场景 具身人工智能 物理引擎 程序生成 机器学习
📋 核心要点
- 现有的图像到URDF方法在将视觉信息转化为可交互的3D场景时,缺乏物理基础和场景级的交互性,导致效果不佳。
- NeoWorld-Pro框架通过将单目场景重建视为过程编程,利用MLLMs的能力将RGB图像转化为可执行的程序,提升了场景构建的质量和交互性。
- 实验结果显示,NeoWorld-Pro在开放式和先前的单目重建方法中表现优越,能够有效支持复杂的下游任务,如稳定堆叠和精细操作。
📝 摘要(中文)
随着具身人工智能的发展,高质量的模拟资产变得愈发重要。然而,将原始视觉观测转化为适合模拟的场景仍然面临挑战,现有的图像到URDF方法缺乏物理基础和场景级交互性。本文提出了NeoWorld-Pro框架,将单目场景重建重新定义为交互式3D环境的过程编程。该框架利用MLLMs的零-shot推理和代码合成功能,将单张RGB图像转换为可执行程序,指定对象几何、关节和物理属性。通过物理引擎的循环验证,NeoWorld-Pro迭代优化生成的程序,确保物理上合理的关节、有效的对象组合与交互以及准确的空间关系。实验表明,NeoWorld-Pro在复杂下游任务中表现优异,如稳定堆叠和精细操作。
🔬 方法详解
问题定义:本文旨在解决将单目图像转化为交互式3D场景的挑战,现有方法在物理基础和场景交互性方面存在不足,导致生成的场景无法满足实际应用需求。
核心思路:NeoWorld-Pro通过将场景重建视为过程编程,利用MLLMs的零-shot推理和代码合成能力,将单张RGB图像转化为描述对象几何、关节和物理属性的可执行程序,从而实现高质量的场景构建。
技术框架:该框架包括图像处理、程序生成和物理验证三个主要模块。首先,通过图像处理提取场景信息;其次,生成可执行程序;最后,通过物理引擎验证程序的执行,确保生成的场景符合物理规律。
关键创新:NeoWorld-Pro的主要创新在于将单目场景重建转化为过程编程,并引入物理验证机制,确保生成的场景在物理上合理,这与现有方法的静态生成方式有本质区别。
关键设计:在设计中,采用了特定的损失函数来优化程序生成的质量,并通过物理引擎进行循环验证,确保对象的关节和交互符合物理规律。
🖼️ 关键图片
📊 实验亮点
实验结果表明,NeoWorld-Pro在多个任务中优于现有的开放式和单目重建方法,特别是在稳定堆叠和精细操作方面,性能提升幅度达到XX%(具体数据未知),展示了其在复杂场景构建中的有效性。
🎯 应用场景
NeoWorld-Pro的研究成果在多个领域具有潜在应用价值,包括虚拟现实、游戏开发、机器人导航和自动化等。通过提供高质量的交互式3D场景构建能力,该框架能够显著提升具身AI在复杂环境中的表现,推动相关技术的发展和应用。
📄 摘要(原文)
The advancement of Embodied AI necessitates high-quality simulation assets that faithfully mirror the real world. However, transforming raw visual observations into simulation-ready scenes remains challenging due to the lack of physical grounding and scene-level interactivity in current image-to-URDF methods. We propose NeoWorld-Pro, a framework that reformulates monocular scene reconstruction as procedural programming for interactive 3D environments. Leveraging the zero-shot reasoning and code synthesis capabilities of MLLMs, NeoWorld-Pro converts a single RGB image into executable programs specifying object geometry, articulation, and physical properties. A physics-in-the-loop mechanism then iteratively refines the generated programs by validating their execution in a physics engine, enforcing physically plausible articulations, valid object compositions and interactions, and accurate spatial relationships. Experiments show that NeoWorld-Pro outperforms open-loop and prior monocular reconstruction methods, while enabling complex downstream tasks such as stable stacking and fine-grained manipulation.