RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera
作者: Zhaochen Lan, Mengxiang Lin
分类: cs.RO
发布日期: 2026-08-10
💡 一句话要点
提出RoboSeg以解决机器人操作中的部件级语义重建问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 机器人操作 语义重建 视觉-语言模型 RGB-D重建 抓取生成 异步处理 部件识别
📋 核心要点
- 现有的机器人操作方法往往无法有效识别和利用可操作部件,限制了其在复杂环境中的应用。
- RoboSeg通过结合视觉-语言模型和异步在线重建技术,实现了对部件级语义的实时识别和抓取生成。
- 实验结果表明,RoboSeg在部件交并比和任务成功率上均表现优异,显示出其在实际操作中的有效性。
📝 摘要(中文)
机器人操作需要识别可操作部件,如把手、边缘、触发器和工具尖端,而不仅仅是物体类别或点云。本文提出了RoboSeg,一个部件级语义重建系统,结合了视觉-语言模型(VLM)功能部件发现、异步在线RGB-D语义重建和任务导向的抓取生成,无需CAD模型或预扫描网格。RoboSeg通过初始RGB观察查询VLM以获得紧凑的功能部件提示,然后通过两个异步流进行扫描:一个用于RGB-D里程计和截断符号距离函数(TSDF)融合的高频几何线程,以及一个用于SAM3部件掩码的关键帧触发语义线程。通过体素级时间投票将投影掩码融合为持久的部件标记点云,RoboSeg利用该地图将AnyGrasp 6-DoF候选分配给语义部件,并选择与任务相关部件标签一致的抓取。RoboSeg在手动标记物体上达到83.4%的平均部件交并比(mIoU),在四个物体和八个任务的24次物理试验中,所选抓取在所有试验中都接触到请求的部件,并实现21/24的任务成功率。
🔬 方法详解
问题定义:本文旨在解决机器人操作中对可操作部件的识别和语义重建问题。现有方法通常只关注物体类别或点云,无法满足复杂操作的需求。
核心思路:RoboSeg的核心思路是通过视觉-语言模型(VLM)获取功能部件提示,并结合异步RGB-D重建技术,实现对部件的精确识别和抓取生成。这样的设计使得系统能够在没有CAD模型或预扫描网格的情况下,实时处理和识别部件。
技术框架:RoboSeg的整体架构包括三个主要模块:首先,通过初始RGB观察查询VLM以获取功能部件提示;其次,利用高频几何线程进行RGB-D里程计和TSDF融合,同时通过关键帧触发的语义线程获取部件掩码;最后,将投影掩码通过体素级时间投票融合为持久的部件标记点云。
关键创新:RoboSeg的主要创新在于其将视觉-语言模型与异步在线重建相结合,形成了一种新的部件级语义重建方法。这一方法与传统的依赖于静态模型的重建方式有本质区别,能够更灵活地应对动态环境中的操作需求。
关键设计:在设计上,RoboSeg采用了高频几何线程和关键帧触发的语义线程的异步处理方式,以提高重建的实时性和准确性。此外,系统通过体素级时间投票的方式融合掩码,确保了部件标记的持久性和准确性。实验中使用的AnyGrasp 6-DoF候选生成方法也为抓取选择提供了有效支持。
🖼️ 关键图片
📊 实验亮点
RoboSeg在手动标记物体上达到了83.4%的平均部件交并比(mIoU),并在24次物理试验中实现了21/24的任务成功率,显示出其在实际操作中的高效性和可靠性。
🎯 应用场景
RoboSeg的研究成果在机器人操作、自动化装配和智能家居等领域具有广泛的应用潜力。通过实现对部件级语义的实时识别,RoboSeg能够提升机器人在复杂环境中的操作能力,推动智能机器人技术的发展与应用。
📄 摘要(原文)
Robotic manipulation requires perception systemsthat identify actionable parts such as handles, rims, triggers,and tool tips, not merely object categories or point clouds. This paper presents RoboSeg, a part-level semantic reconstructionsystem that links vision-language model (VLM) functional-partdiscovery, asynchronous online RGB-D semantic reconstruc-tion, and task-oriented grasp generation without requiring CAD models or pre-scanned meshes. RoboSeg queries a VLM onthe initial RGB observation to obtain compact functional part prompts, then scans with two asynchronous streams: a high-frequency geometry thread for RGB-D odometry and truncated signed distance function (TSDF) fusion, and a keyframe-triggered semantic thread for SAM3 part masks. Projectedmasks are fused by voxel-level temporal voting into a persistentpart-labeled point cloud; RoboSeg uses this map to assign AnyGrasp 6-DoF candidates to semantic parts and select grasps consistent with the task-relevant part label. RoboSeg reaches 83.4% mean part intersection-over-union (mIoU) over manually labeled objects; in a 24-trial physical pilot across fourobjects and eight tasks, the selected grasp contacts the requestedpart in all trials and achieves 21/24 combined task successes.These results characterize RoboSeg as a semantic indexing layerfor task-conditioned manipulation, with AnyGrasp retained asthe proposal generator.