DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception
作者: Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz
分类: cs.RO, cs.CV
发布日期: 2026-08-31
💡 一句话要点
提出DARP数据集以解决多视角机器人感知问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 双臂机器人 RGB-D-IR数据集 多视角感知 几何一致性 主动感知 多模态融合 机器人感知
📋 核心要点
- 现有的单视角机器人感知方法受到自遮挡和表面可见性不足的限制,导致感知效果不佳。
- 本文提出DARP数据集,通过双臂独立移动的手眼操控器进行多视角数据采集,提升了对象中心的感知能力。
- 实验结果表明,DARP在224个RGB-D关键帧上实现了2.13mm的中位点到网格距离,显著提高了几何一致性。
📝 摘要(中文)
机器人从单一视角进行感知常常受到自遮挡和表面可见性不足的限制。本文提出了DARP(双臂机器人感知)数据集,这是一个经过校准的双臂RGB-D-IR数据集,旨在支持基于对象的机器人感知。该数据集使用两个独立移动的手眼操控器,在共享的桌面工作区两侧进行数据采集。每个手臂配备Intel RealSense传感器,持续记录RGB、深度和立体红外数据,同时同步记录机器人关节状态以便于姿态恢复。DARP包含十个独特的桌面物体,并保留原始传感器记录、机器人状态日志、物体级元数据和重建相机轨迹所需的校准信息。通过实施确定性的多视角融合管道,评估了采集的几何一致性,结果显示在224个RGB-D关键帧上,点到网格的中位距离为2.13mm,RMSE为4.04mm,96.56%的点在测量表面网格的10mm范围内。
🔬 方法详解
问题定义:本文旨在解决单一视角下机器人感知的局限性,特别是自遮挡和表面可见性不足的问题。现有方法在复杂环境中难以获取完整的物体信息,影响了机器人的感知能力。
核心思路:通过构建DARP数据集,利用双臂独立移动的手眼操控器,进行多视角的RGB-D-IR数据采集,从而增强对物体的感知能力。该设计允许在不同视角下获取更全面的物体信息,克服了单一视角的局限。
技术框架:DARP的数据采集流程包括自动定位、跨臂确认、自适应视角生成和连续的多模态记录。每个手臂配备传感器,实时记录RGB、深度和红外数据,同时同步记录机器人状态。
关键创新:DARP的主要创新在于其双臂协同工作方式和多模态数据采集策略,能够在复杂环境中实现高效的对象中心感知,与传统单视角方法相比,显著提升了数据的完整性和准确性。
关键设计:在数据采集过程中,采用了高精度的传感器校准技术,确保RGB-D数据的准确性。同时,设计了一个确定性的多视角融合管道,将校准后的RGB-D观测转换为互补的部分点云和测量表面网格,避免了依赖学习或生成补全方法。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在224个RGB-D关键帧上,DARP实现了2.13mm的中位点到网格距离和4.04mm的RMSE,96.56%的点在测量表面网格的10mm范围内,表明其在几何一致性方面的优越性。
🎯 应用场景
DARP数据集可广泛应用于多视角重建、协作机器人感知、多模态融合和主动感知等领域。其高质量的数据和详细的元信息为未来的学习基础推理提供了重要支持,具有显著的实际价值和研究潜力。
📄 摘要(原文)
Robotic perception from a single viewpoint is often limited by self-occlusion and incomplete surface visibility. This paper presents DARP(Dual-Arm Robotic Perception) https://doi.org/10.21227/rmv3-be47, a calibrated dual-arm RGB-D-IR dataset for object-centered robotic perception using two independently moving eye-in-hand manipulators positioned on opposite sides of a shared tabletop workspace. Each arm carries an Intel RealSense sensor that continuously records RGB, depth, and stereo infrared data while synchronized robot joint states are logged for pose recovery. Objects are placed without fixed poses or marked locations, and the acquisition procedure performs automatic localization, cross-arm confirmation, adaptive viewpoint generation, and continuous multimodal recording. DARP contains ten unique tabletop objects and preserves the original sensor recordings, robot-state logs, object-level metadata, and calibration information required to reconstruct camera trajectories in a shared metric frame. To evaluate the geometric consistency of the acquisition, we implement a deterministic multi-view fusion pipeline that converts calibrated RGB-D observations into complementary partial point clouds and measured surface meshes without using learned or generative completion methods. Evaluation on 224 held-out RGB-D keyframes comprising 1,563,466 three-dimensional query points yields a median point-to-mesh distance of 2.13~mm and an RMSE of 4.04~mm, with 96.56\% of points within 10~mm of the measured-surface mesh. DARP is intended as a reusable resource for multi-view reconstruction, collaborative robotic perception, multimodal fusion, active perception, and future learning-based reasoning over partial object observations.