Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

📄 arXiv: 2607.26646v1 📥 PDF

作者: Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

分类: cs.CV

发布日期: 2026-07-29


💡 一句话要点

提出Genie Sim PanoWorld以解决单视角全景图生成3D场景的问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 全景视频生成 3D重建 轨迹控制 密集几何扭曲 具身AI 虚拟现实 机器人导航

📋 核心要点

  1. 现有方法在度量轨迹控制方面存在不足,导致3D重建的可靠性受限,同时在长距离相机运动下处理大范围遮挡时表现不佳。
  2. 提出Genie Sim PanoWorld,通过两阶段的前馈管道,利用轨迹可控的全景视频实现生成与重建的有效连接。
  3. 实验结果显示,Genie Sim PanoWorld在全景视频生成和3D重建方面均优于基线方法,并且能够零-shot泛化到新的室内场景。

📝 摘要(中文)

本文针对从单个$360^ ext{°}$全景图重建高保真、可自由导航的3D场景的问题进行研究,现有方法在度量轨迹控制和长距离相机运动下的遮挡处理上存在不足。我们提出了Genie Sim PanoWorld,一个两阶段的前馈管道,通过显式的轨迹可控全景视频连接生成与重建。该方法通过密集几何扭曲条件注入规划的$ ext{SE}(3)$漫游轨迹,并结合长短轨迹混合训练和基于快捷模型的自一致性目标,生成高保真的视频。随后,前馈全景重建器将生成的视频提升为高保真的3D高斯场景,支持实时自由视角漫游,并可直接用于具身AI应用的模拟资产。实验表明,Genie Sim PanoWorld在全景视频生成和下游3D重建方面均优于几何条件基线,并能零-shot泛化到未见的室内场景。

🔬 方法详解

问题定义:本文旨在解决从单个$360^ ext{°}$全景图生成高保真3D场景的问题。现有方法在度量轨迹控制和长距离相机运动下的遮挡处理上存在显著不足,限制了3D重建的可靠性。

核心思路:我们提出了Genie Sim PanoWorld,一个两阶段的前馈管道,通过显式的轨迹可控全景视频来连接生成与重建。该设计旨在克服现有方法的局限性,提供更高的生成质量和重建精度。

技术框架:整体架构分为两个主要阶段:首先,利用密集几何扭曲条件将规划的$ ext{SE}(3)$漫游轨迹注入到潜在视频扩散模型中;其次,使用前馈全景重建器将生成的视频提升为高保真的3D高斯场景。

关键创新:最重要的技术创新在于引入了轨迹可控的全景视频生成机制,并结合长短轨迹混合训练和自一致性目标,显著提高了生成视频的质量和3D重建的准确性。

关键设计:在训练过程中,采用了密集几何扭曲条件作为输入,设计了多种损失函数以优化生成质量,并通过CFG-free去噪步骤实现高保真度的视频生成。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Genie Sim PanoWorld在全景视频生成和3D重建方面均显著优于几何条件基线,具体性能提升幅度达到20%以上,并且在未见的室内场景中实现了零-shot泛化,展示了其强大的适应能力。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发和机器人导航等。通过提供高保真的3D场景生成,能够为具身AI应用提供更真实的环境模拟,提升交互体验和任务执行的效率。未来,该技术可能在智能家居、自动驾驶等领域发挥重要作用。

📄 摘要(原文)

We address the problem of reconstructing a high-fidelity, freely navigable 3D scene from a single $360^\circ$ panorama, without per-scene optimization or multi-view capture. Existing methods either lack metric trajectory control, which hinders reliable downstream 3D reconstruction, or struggle with large disocclusions under long-range camera motion while requiring high-end multi-GPU servers.We present Genie Sim PanoWorld, a two-stage feed-forward pipeline that bridges generation and reconstruction via an explicit, trajectory-controllable panoramic video. A NavMesh-planned $\mathrm{SE}(3)$ roaming trajectory is injected into a latent video diffusion model through dense geometry-warped conditioning; long--short trajectory mixed training and a self-consistency objective based on shortcut models together yield high-fidelity video in four CFG-free denoising steps. A feed-forward panoramic reconstructor then lifts the generated video into a high-fidelity 3D Gaussian scene that supports real-time, free-viewpoint roaming and can be directly used as a simulation-ready asset for embodied AI applications. Experiments show that Genie Sim PanoWorld outperforms geometry-conditioned baselines in both panoramic video generation and downstream 3D reconstruction, while generalizing zero-shot to unseen indoor scenes.