SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

📄 arXiv: 2607.25912v1 📥 PDF

作者: Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

分类: cs.RO, cs.AI

发布日期: 2026-07-28

备注: 8 pages, 4 figures


💡 一句话要点

提出SAM3D引导的物体中心3D表示对齐框架以解决VLA模型的3D理解问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 3D表示 物体识别 机器人操作 深度学习

📋 核心要点

  1. 现有的VLA模型主要依赖2D视觉-语言骨干,缺乏对目标物体的细粒度3D理解,导致在复杂场景下的操作能力受限。
  2. 本文提出了一种基于SAM3D的物体中心3D表示对齐框架,通过引入3D先验信息来增强模型的空间理解能力。
  3. 实验结果表明,所提方法在多个基准测试中表现优异,尤其在长时间操作任务中显著提升了机器人对目标物体的处理能力。

📝 摘要(中文)

视觉-语言-动作(VLA)模型在通用机器人操作中展现出强大的潜力,但现有模型主要依赖于2D视觉-语言骨干,缺乏对目标物体的细粒度3D理解,尤其在遮挡、姿态变化、尺度变化和精确空间交互等情况下。本文提出了一种基于SAM3D的物体中心3D表示对齐框架,利用SAM3D作为冻结的3D教师,在训练过程中提供目标物体的3D先验信息。具体而言,我们通过物体识别模型定位任务相关物体,生成相应的物体掩码,并使用SAM3D提取稠密的物体级3D表示,与$π_0$的中间视觉特征进行对齐。这使得策略能够内化目标物体的3D信息,同时在测试时无需深度、点云、掩码、SAM3D或额外的3D模块。仿真实验显示出一致的改进,在LIBERO上达到了99.1%的准确率,在CALVIN上平均长度为4.11。实际实验进一步表明,该方法在长时间操作场景中特别有效,机器人能够在多个子任务中关注不同的目标物体。

🔬 方法详解

问题定义:本文旨在解决现有VLA模型在复杂环境下对目标物体的3D理解不足的问题,尤其是在遮挡和姿态变化等情况下的操作能力受限。

核心思路:通过引入SAM3D作为冻结的3D教师,提供目标物体的3D先验信息,从而增强模型对物体的空间理解能力,同时保持原有的RGB-语言-动作推理流程。

技术框架:整体框架包括物体识别、物体掩码生成和3D表示提取三个主要模块。首先,利用物体识别模型定位任务相关物体;其次,生成物体掩码;最后,使用SAM3D提取稠密的物体级3D表示,并与$π_0$的中间视觉特征进行对齐。

关键创新:最重要的创新在于将SAM3D引入到VLA模型中,提供了一个有效的3D表示对齐机制,使得模型能够在不依赖额外3D模块的情况下,内化目标物体的3D信息。

关键设计:在设计中,采用了特定的损失函数来优化3D表示与视觉特征的对齐,同时确保在测试时不需要额外的3D信息输入,简化了模型的使用流程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在LIBERO基准上达到了99.1%的准确率,并在CALVIN任务中实现了平均长度4.11的优异表现,显著优于现有基线,尤其在长时间操作任务中表现突出。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动化制造和智能家居等场景。通过增强机器人对目标物体的3D理解能力,能够提升其在复杂环境中的操作精度和灵活性,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Vision-Language-Action (VLA) models have shown strong potential for general robot manipulation, but most existing models rely on 2D visual-language backbones and lack fine-grained 3D understanding of target objects, especially under occlusion, pose variation, scale changes, and precise spatial interaction. We propose an object-centric 3D representation alignment framework built upon $π_0$, using SAM3D as a frozen 3D teacher to provide target-object 3D priors during training. Specifically, we localize task-relevant objects with object recognition models, generate corresponding object masks, and use SAM3D to extract dense object-level 3D representations, which are aligned with intermediate visual features of $π_0$. This enables the policy to internalize target-object 3D information while preserving the original RGB-language-to-action inference pipeline without requiring depth, point clouds, masks, SAM3D, or additional 3D modules at test time. Simulation experiments show consistent improvements, achieving 99.1\% on LIBERO and an average length of 4.11 on CALVIN. Real-world experiments further demonstrate that our method is particularly effective in long-horizon manipulation scenarios where the robot must focus on different target objects across multiple subtasks.