Robust Slip Detection and Material Classification via Spatiotemporal Transformers on a Uniformly-Illuminated Visuo-Tactile Sensor
作者: Ziyang Ma, Yuhao Sun, Zichen Ai, Xiangyang Ji, Bin Fang
分类: cs.RO
发布日期: 2026-08-25
备注: Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. 8 pages, 10 figures
💡 一句话要点
提出基于时空变换器的稳健滑移检测与材料分类方法
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱八:物理动画 (Physics-based Animation)
关键词: 触觉传感 滑移检测 材料分类 时空变换器 多模态感知 机器人操作 深度重建
📋 核心要点
- 现有滑移检测方法主要集中于二分类,缺乏对滑移方向的细粒度感知,限制了其在复杂操作中的应用。
- 本文提出了一种新型的视觉-触觉传感器,结合均匀RGB照明和统一感知框架,能够实现高精度的深度重建和多任务数据采集。
- 在实验中,所提网络在未见物体上实现了95.5%的三类接触状态预测准确率和91.5%的八类滑移方向分类准确率,显示出显著的性能提升。
📝 摘要(中文)
触觉传感在机器人操作中至关重要,其中滑移检测是一个关键任务。然而,现有的滑移数据集主要限于二分类,缺乏细粒度的方向感知。为了解决这一局限性,本文提出了一种具备定制均匀RGB照明的视觉-触觉传感器,并构建了统一的感知框架。在硬件层面,该传感器实现了高精度的亚毫米深度重建。基于此能力,我们收集了一个多任务视觉-触觉数据集,涵盖15个物体,并为每个数据样本同步生成深度信息。在算法上,我们设计了一个双头的TimeSformer网络来处理动态时空滑移。在未见物体上,该网络在三类接触状态预测和细粒度八类滑移方向分类中分别达到了95.5%和91.5%的准确率。此外,基于静态触觉的物体类别识别使用ResNet-50主干在15个类别中达到了98.8%的卓越准确率。所提出的硬件-软件框架为复杂的机器人操作提供了高保真反馈和强大的多模态感知基线。
🔬 方法详解
问题定义:本文旨在解决现有滑移检测方法在细粒度方向感知方面的不足,现有数据集主要限于二分类,无法满足复杂操作的需求。
核心思路:提出了一种结合视觉与触觉信息的传感器,利用均匀RGB照明提高数据质量,并设计了双头TimeSformer网络以处理动态时空滑移。
技术框架:整体架构包括硬件传感器和算法模型两个部分。硬件部分实现高精度深度重建,算法部分则通过TimeSformer网络进行滑移检测与材料分类。
关键创新:最重要的创新在于提出了一个多任务的视觉-触觉数据集和双头时空变换器网络,能够同时进行接触状态预测和滑移方向分类,显著提升了检测的准确性。
关键设计:在网络设计中,采用了双头结构以处理不同任务,损失函数设计上考虑了多任务学习的平衡,确保各任务间的协同优化。
🖼️ 关键图片
📊 实验亮点
在实验中,所提出的双头TimeSformer网络在未见物体上实现了95.5%的三类接触状态预测准确率和91.5%的八类滑移方向分类准确率,相较于现有方法有显著提升。此外,静态触觉物体分类的准确率达到了98.8%,展示了该框架的强大性能。
🎯 应用场景
该研究的潜在应用领域包括机器人抓取、自动化装配和人机交互等场景。通过提高滑移检测的准确性和材料分类能力,能够显著提升机器人在复杂环境中的操作能力,推动智能制造和服务机器人技术的发展。
📄 摘要(原文)
Tactile sensing is central to robotic manipulation, among which slip detection stands out as a quintessential and critical task. However, existing slip datasets are predominantly limited to binary classification, lacking fine-grained directional perception. To address this limitation, we propose a visuo-tactile sensor featuring customized uniform RGB illumination, alongside a unified perception framework. At the hardware level, the sensor achieves high-precision, sub-millimeter depth reconstruction. Based on this capability, we collect a multi-task visuo-tactile dataset encompassing 15 objects, synchronously generating depth information for each data sample. Algorithmically, we design a dual-head TimeSformer network to process dynamic spatiotemporal slip. On unseen objects, this network achieves robust accuracies of 95.5% and 91.5% for 3-class contact state prediction and fine-grained 8-class slip direction classification, respectively. Furthermore, static tactile-based object class recognition utilizing a ResNet-50 backbone yields an outstanding accuracy of 98.8% across 15 categories. The proposed hardware-software framework provides high-fidelity feedback and a powerful multi-modal perception baseline for complex robotic manipulation.