Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring
作者: Marin Maletic, Goran Vasiljevic
分类: cs.RO, cs.AI
发布日期: 2026-08-28
备注: 6 pages, ICCAS 2026 preprint
💡 一句话要点
提出无训练的吸取抓取检测方法以解决变形无菌纸箱分类问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 无训练抓取 视觉-语言模型 几何评分 变形物体 机器人分类 自动化回收 实例掩膜
📋 核心要点
- 现有的机器人分类方法在处理变形和几何不一致的可回收物体时效果不佳,导致抓取成功率低。
- 本文提出了一种无训练的吸取抓取系统,通过视觉-语言模型和几何评分方法实现目标识别与抓取点选择的解耦。
- 在真实机器人上进行的实验显示,该系统在不同变形水平和杂乱场景下的单对象抓取成功率达到88.2%。
📝 摘要(中文)
机器人在可回收废物分类中面临挑战,尤其是目标物体的变形和几何不一致性。本文提出了一种无训练的吸取抓取系统,专注于变形无菌饮料纸箱的分类。该系统将目标识别与抓取点选择解耦,利用开放词汇的视觉-语言模型从文本提示中检测纸箱,SAM2进一步将每个检测结果精炼为实例掩膜,最后通过结合表面平整度和法线对齐的几何评分方法选择吸取点。通过对比三种几何方法,实验证明该系统在真实机器人上实现了88.2%的单对象抓取成功率和72.6%的杂乱环境下的端到端检索成功率。
🔬 方法详解
问题定义:本文旨在解决变形无菌纸箱的抓取检测问题。现有方法往往依赖于大量训练数据,难以适应几何不一致的目标物体,导致抓取成功率低下。
核心思路:本研究提出了一种无训练的吸取抓取系统,通过将目标识别与抓取点选择解耦,利用开放词汇的视觉-语言模型进行目标检测,进而提高抓取的灵活性和准确性。
技术框架:系统主要包括三个模块:首先,使用视觉-语言模型从文本提示中检测纸箱;其次,利用SAM2对检测结果进行实例掩膜的精炼;最后,通过几何评分方法选择最佳吸取点。
关键创新:该研究的创新点在于无训练的设计理念,结合视觉-语言模型与几何评分方法,显著提高了对变形物体的抓取能力,与传统依赖训练的抓取方法形成鲜明对比。
关键设计:在几何评分方法中,本文比较了三种技术:k近邻PCA、Sobel叉乘和RANSAC平面拟合,以选择最佳的吸取点,确保抓取的稳定性和成功率。实验结果表明,所提出的方法在不同场景下均表现出色。
🖼️ 关键图片
📊 实验亮点
实验结果显示,单对象抓取成功率达到88.2%,在杂乱环境中的端到端检索成功率为72.6%。与传统方法相比,该系统在处理不同变形水平的纸箱时表现出更高的抓取成功率,验证了其有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括自动化垃圾分类、智能回收系统和机器人抓取任务等。通过提高对变形物体的抓取能力,该系统可以显著提升资源回收效率,减少人工干预,推动可持续发展目标的实现。
📄 摘要(原文)
Robotic sorting of recyclable waste is challenging due to the deformable and geometrically inconsistent nature of target objects. We present a training-free suction grasping system for sorting deformed aseptic beverage cartons, decoupling target identification from grasp-point selection. An open-vocabulary vision-language model detects cartons from a text prompt, SAM2 refines each detection into an instance mask, and a geometric scoring method selects the suction point by combining surface flatness with normal alignment. Three geometric methods are compared: k-nearest-neighbour PCA, Sobel cross-product, and RANSAC plane fitting. Evaluated on a real robot across three deformation levels and 35 cluttered scenes, single-object grasp success reaches 88.2% and end-to-end retrieval in clutter is 72.6%.