Video2DoorTraversal: Push Door Traversal via Simulated Door Twins

📄 arXiv: 2608.20251v1 📥 PDF

作者: Xincheng Tang, Yiji Chen, Youhan Xie, Wanyu Li, Zhengjie Shu, Lai Jiang, Wenkang Hu, Yitong Li, Jinchuang Zhang, Xibin Song, Ruigang Yang

分类: cs.RO

发布日期: 2026-08-20

备注: 8 pages, 6 figures

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Video2DoorTraversal以解决推门穿越任务

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 长时间操控 门的双胞胎模型 模拟训练 机器人控制 交互感知

📋 核心要点

  1. 现有方法在推门和穿越任务中面临长时间操控的挑战,尤其是在精确的把手交互和协调控制方面。
  2. 论文提出了一种单视频真实-模拟-真实框架,通过重建门的双胞胎模型来实现高效的操控训练。
  3. 实验结果显示,该系统在真实环境中实现了96.57%的成功率,并在未见门上达到了80.95%的零-shot成功率,表现出色。

📝 摘要(中文)

推门和穿越是一个需要精确把手交互和协调底盘-臂控制的长时间运动操控任务。我们提出了Video2DoorTraversal,这是一个针对轮腿移动操控器的单视频真实-模拟-真实框架。给定一段真实门的RGB视频,DoorTwin重建了一个实例对齐、关节化且适合模拟的门双胞胎,具有逼真的几何形状和外观。一个模拟循环代理将恢复的关节转换为参数化技能程序,并迭代优化失败的执行,以生成物理可执行的演示。这些演示用于训练ArticuACT,一个双深度策略,预测协调的底盘、手臂和夹持器指令,使用机器人中心的相机条件和交互感知监督。该系统在五扇真实门上实现了96.57%的平均成功率,并在结构相似的未见门上达到了80.95%的零-shot成功率,同时在平均约13秒内完成了完整的接近、开启和穿越序列。

🔬 方法详解

问题定义:本论文旨在解决推门穿越这一复杂的长时间运动操控任务。现有方法在处理门的开关和穿越时,往往缺乏精确的把手交互和协调的底盘-臂控制,导致成功率低下。

核心思路:论文提出的Video2DoorTraversal框架利用单一RGB视频重建门的双胞胎模型,进而通过模拟环境进行操控训练。这种方法通过真实-模拟-真实的循环,提升了模型的适应性和执行能力。

技术框架:整体架构包括三个主要模块:首先,DoorTwin模块负责从RGB视频中重建门的几何和外观;其次,模拟循环代理将重建的关节信息转化为可执行的技能程序;最后,ArticuACT策略网络根据机器人中心的相机输入和交互感知进行指令预测。

关键创新:最重要的创新在于通过单视频重建门的双胞胎模型,并结合模拟环境进行迭代优化,这种方法在处理复杂的操控任务时显著提高了成功率。

关键设计:在模型设计中,采用了双深度策略网络ArticuACT,结合了机器人中心的相机条件和交互感知监督,以确保指令的协调性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Video2DoorTraversal系统在五扇真实门的测试中实现了96.57%的平均成功率,并在结构相似的未见门上达到了80.95%的零-shot成功率,显示出优越的适应性和执行效率。

🎯 应用场景

该研究的潜在应用场景包括智能家居中的机器人助手、服务机器人在公共场所的导航,以及工业自动化中的物料搬运等。通过提升机器人在复杂环境中的操控能力,未来可能会显著改善人机交互的效率和安全性。

📄 摘要(原文)

Door opening and traversal is a long-horizon loco-manipulation task that requires precise handle interaction and coordinated base-arm control. We present Video2DoorTraversal, a single-video real-to-sim-to-real framework for wheel-legged mobile manipulators. Given one RGB video of a real door, DoorTwin reconstructs an instance-aligned, articulated, and simulation-ready door twin with realistic geometry and appearance. A simulation-in-the-loop agent converts the recovered articulation into a parameterized skill program and iteratively refines failed rollouts to generate physically executable demonstrations. These demonstrations are used to train ArticuACT, a dual-depth policy that predicts coordinated base, arm, and gripper commands using robot-centric camera conditioning and interaction-aware supervision. With all perception and policy inference running onboard, the system achieves a 96.57% average success rate across five real doors and an 80.95% zero-shot success rate on structurally similar unseen doors, while completing the full approach, opening, and traversal sequence in approximately 13s on average. Project Page: https://video2doortraversal.github.io/.