R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim
作者: Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen
分类: cs.RO, cs.CV, cs.GR
发布日期: 2026-08-07
备注: 11 pages, 6 figures, 4 tables, and 1 algorithm
💡 一句话要点
提出R2S-EGO以解决稀疏捕获下的真实到模拟问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 真实到模拟 机器人代理 几何代理 稀疏捕获 场景理解 视觉资产精炼 动态更新
📋 核心要点
- 现有的真实到模拟方法在稀疏捕获情况下,无法有效支持机器人行为范围内的视图,导致性能不足。
- R2S-EGO通过结合机器人代理和几何代理,优化了捕获过程,提升了场景的结构条件,解决了视图缺失问题。
- 在48个冻结的Unitree G1自我视图中,R2S-EGO的PSNR达到了19.062 dB,相较于最强基线提升了4.836 dB,成功率也显著提高。
📝 摘要(中文)
真实到模拟(R2S)依赖于沿机器人自我轨迹渲染观察的场景表示,但密集的多视角捕获限制了每个环境的真实图像捕获效率,而稀疏的人类捕获可能导致行为范围内的机器人视图支持不足。相机控制合成可以填补缺失视图,但在R2S中的应用需要行为可接受的查询和捕获锚定的结构条件。我们提出了R2S-EGO,它结合了一个模拟器派生的机器人代理,表示行为范围内的可执行查询域,以及一个捕获锚定的几何代理,提供场景特定的结构条件。在该域内,固定预算选择目标当前支持缺口,以便获得几何支持。生成的观察被同化为伪观察,以精炼视觉资产,而真实捕获仍然是锚点。融合的几何代理还提供了场景碰撞表面,并在轮次之间刷新。通过这些更新,现有的模拟场景得到精炼,同时机器人的动态和控制栈保持固定。
🔬 方法详解
问题定义:论文旨在解决在稀疏捕获情况下,真实到模拟(R2S)方法无法有效支持机器人行为范围内视图的问题。现有方法在捕获效率和支持能力上存在明显不足。
核心思路:R2S-EGO的核心思路是结合一个模拟器派生的机器人代理和一个捕获锚定的几何代理,以优化场景的结构条件和捕获过程,从而填补缺失的视图。
技术框架:整体架构包括两个主要模块:机器人代理用于表示可执行查询域,几何代理用于提供场景特定的结构条件。通过固定预算选择当前支持缺口,并生成伪观察以精炼视觉资产。
关键创新:R2S-EGO的创新在于将机器人代理与几何代理结合,形成一个动态更新的框架,使得在稀疏捕获情况下仍能有效提升R2S性能,与现有方法相比具有本质区别。
关键设计:在设计中,关键参数包括固定预算选择策略和伪观察的同化过程,损失函数设计用于优化生成观察的质量,确保真实捕获作为锚点的有效性。整体网络结构则确保了机器人动态和控制栈的稳定性。
🖼️ 关键图片
📊 实验亮点
在实验中,R2S-EGO在48个冻结的Unitree G1自我视图中达到了19.062 dB的PSNR,相较于最强基线的14.226 dB提升了4.836 dB。此外,R2S-EGO在五个配对策略训练种子中实现了82.5%的真实G1坐姿成功率,相比之下,GaussGym仅为10.0%。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动驾驶和虚拟现实等场景。通过提升真实到模拟的转换效率,R2S-EGO能够为机器人提供更为丰富的环境感知能力,进而提升其在复杂环境中的决策和执行能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Real-to-sim (R2S) depends on scene representations that render observations along robot ego trajectories, yet dense multi-view capture limits per-environment real-image capture-count efficiency, and sparse human capture can leave behavior-scoped robot views under-supported. Camera-controlled synthesis can fill missing views, but its use in R2S requires behavior-admissible queries and capture-anchored structural conditioning. We present R2S-EGO, which couples a simulator-derived robot proxy that represents the behavior-scoped executable query domain with a capture-anchored geometry proxy that supplies scene-specific structural conditions. Within this domain, fixed- budget selection targets current support deficits for which geometry support is available. The generated observations are assimilated as pseudo-observations to refine the visual asset, while real captures remain anchors. The fused geometry proxy also supplies the scene collision surface, which is refreshed between rounds. Together, these updates refine the existing simulation scene while its robot dynamics and control stack stay fixed. Across 48 frozen Unitree G1 ego views in three Replica scenes, six-view R2S-EGO reaches 19.062 dB PSNR, compared with 14.226 dB for the strongest reported R2S baseline. Across five paired policy-training seeds, R2S-EGO achieves 82.5% +/- 6.8% real-G1 sitting success, compared with 10.0% +/- 10.5% for GaussGym.