RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction
作者: Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin
分类: cs.CV, cs.RO
发布日期: 2026-08-13
💡 一句话要点
提出Hand2Bot和PassGen以解决人机物体交接预测问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 人机交互 RGB-D视频 生成模型 意图识别 深度学习 机器人技术 数据集构建
📋 核心要点
- 现有的人机物体交接方法受限于缺乏大规模的人本数据集和仿真与现实之间的显著差距,导致预测准确性不足。
- 本文提出了Hand2Bot数据集和PassGen生成管道,通过丰富的上下文信息和深度编辑策略,提升了交接序列的合成质量。
- 实验结果显示,PassGen在意图识别准确性和误触发率方面优于传统的手部中心基线,支持更早的意图预测。
📝 摘要(中文)
人机物体交接(H2R)是人机协作的基本能力,但由于缺乏大规模人本数据集和显著的仿真与现实差距,进展受到限制。为了解决这些挑战,本文引入了Hand2Bot,一个提供丰富上下文信息(如身体姿势和面部表情)的RGB-D视频数据集,专门为交接场景收集,并考虑了现实世界的噪声模式。我们进一步提出了PassGen,一个生成管道,利用稳定的视频扩散和意图感知的时间面部编码器合成逼真的交接序列,同时确保手与物体的一致性。实验评估表明,我们的框架在意图识别准确性和低误触发率方面表现优异,验证了PassGen在零-shot迁移和早期意图预测方面的优势,有效促进了社交意识的机器人行为。
🔬 方法详解
问题定义:本文旨在解决人机物体交接预测中的数据稀缺和仿真与现实之间的差距问题。现有方法在真实场景中的表现不佳,缺乏足够的上下文信息和真实噪声模拟。
核心思路:我们提出了Hand2Bot数据集,专注于交接场景的RGB-D视频数据收集,并设计了PassGen生成管道,通过意图感知的时间面部编码器合成真实的交接序列,确保手与物体的一致性。
技术框架:整体架构包括数据集收集、视频生成和深度编辑三个主要模块。数据集提供丰富的上下文信息,生成管道利用视频扩散技术合成序列,深度编辑模块则模拟现实传感器噪声。
关键创新:最重要的技术创新在于引入了意图感知的时间面部编码器和基于形态的深度编辑策略,显著提升了生成序列的真实感和准确性,与传统方法相比,能够更好地处理现实世界的噪声。
关键设计:在PassGen中,我们设置了特定的损失函数以确保手与物体的一致性,并采用了稳定的视频扩散技术来生成高质量的交接序列。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用PassGen训练的模型在意图识别准确性上达到了高水平,误触发率显著降低。与传统手部中心基线相比,PassGen实现了更早的意图预测,验证了其在实际机器人平台上的有效性。
🎯 应用场景
该研究的潜在应用领域包括人机协作机器人、智能制造和服务机器人等。通过提高人机交接的准确性和效率,能够显著提升机器人在共享工作空间中的社交意识和协作能力,推动智能机器人技术的实际应用和发展。
📄 摘要(原文)
Human-to-robot (H2R) object handover is a fundamental capability for human-robot collaboration, yet progress is hindered by the scarcity of large-scale, human-centric datasets and the significant sim-to-real gap. To address these challenges, we introduce Hand2Bot, an RGB-D video dataset that provides rich contextual information such as body posture and facial expressions, specifically collected for handover scenarios with real-world noise patterns. We further propose PassGen, a generative pipeline that leverages stable video diffusion and an Intention-Aware Temporal Face Encoder to synthesize realistic handover sequences while ensuring hand-object consistency. To bridge the sim-to-real gap, we implement a morphology-based depth editing strategy that replicates realistic sensor noise found in physical depth maps. Experimental evaluations demonstrate that our framework achieves high intention identification accuracy and low false trigger rates in both ablation studies and real-world deployment on a physical robot platform. Our results confirm that training on PassGen allows for robust zero-shot transfer and earlier intention anticipation compared to traditional hand-centric baselines, effectively enabling socially aware robotic behavior in shared workspaces.