DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

📄 arXiv: 2608.28108v1 📥 PDF

作者: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

分类: cs.RO, cs.CV

发布日期: 2026-08-28


💡 一句话要点

提出DeicticVLA以统一语言和指示手势的指令模式

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作模型 指示手势 多模态学习 自然语言处理 机器人操作 人机交互

📋 核心要点

  1. 现有的视觉-语言-动作模型在处理相似对象时,无法有效区分目标,导致任务执行不准确。
  2. DeicticVLA通过将不同的指令模式整合为统一的文本提示和指示掩码,提升了模型的灵活性和准确性。
  3. 实验结果显示,DeicticVLA在多个真实任务中表现优异,尤其在未见类别的任务中成功率达到100%。

📝 摘要(中文)

视觉-语言-动作模型(VLA)使用户能够用自然语言指定操作任务,但在相似外观或同类对象中区分目标或放置目标时,现有模型可能无法可靠地使用详细表达。本文提出DeicticVLA,通过文本提示补全和指示手势定位,将语言指令(LI)、视觉-语言指令(VLI)和视觉指令(VI)规范化为文本提示和指示掩码,使单个预训练的VLA能够处理这三种指令模式。实验结果表明,在两个阶段的训练下,四种提示方法在已知分布中表现良好,但在未见布局中使用指示掩码的能力存在差异。VLI和VI在未见表达、外观变化和新对象下的表现优于LI,未见类别的成功率达到100%。

🔬 方法详解

问题定义:本文旨在解决现有视觉-语言-动作模型在处理相似外观对象时的目标区分问题。现有方法对详细表达的依赖使得模型在复杂场景中表现不佳。

核心思路:DeicticVLA通过将语言指令、视觉-语言指令和视觉指令统一为文本提示和指示掩码,利用指示手势增强模型的理解能力,从而提升任务执行的准确性和灵活性。

技术框架:该方法采用共享的骨干网络,结合演示和匹配的训练步骤,比较了两种RGB视觉提示方法、两种独立通道掩码提示方法和三种训练策略。整体流程包括文本提示生成、指示掩码的应用和任务执行。

关键创新:DeicticVLA的主要创新在于其统一的三模式接口,使得单一模型能够处理多种指令模式,显著提高了模型在未见布局中的适应能力。

关键设计:在训练过程中,采用两阶段训练策略,保留第二阶段的LI数据以减少遗忘,同时不影响VLI和VI的性能。关键参数设置和损失函数设计确保了模型在不同任务中的稳定性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,在未见类别的任务中,DeicticVLA的成功率达到100%,而联合训练的语言指令仅为16.7%。在多种真实任务中,VLI和VI的表现优于LI,显示出该模型在处理复杂场景中的优势。

🎯 应用场景

DeicticVLA的研究成果在机器人操作、智能助手和人机交互等领域具有广泛的应用潜力。通过提升模型对自然语言和手势的理解能力,该技术能够实现更为自然和高效的交互方式,推动智能系统的普及与发展。

📄 摘要(原文)

Vision-Language-Action models (VLAs) allow users to specify manipulation tasks in natural language, but distinguishing a target or placement goal among objects of the same category or similar appearance requires detailed expressions that VLAs may not use reliably. We propose DeicticVLA, which canonicalizes Language Instruction (LI), Vision-Language Instruction (VLI), and Visual Instruction (VI) into a text prompt and deictic masks through text-prompt completion and deictic gesture grounding, enabling a single pretrained VLA to handle all three instruction modes. With a shared backbone, demonstrations, and matched training steps, we compare two RGB visual prompting methods, two separate-channel mask prompting methods, and three training strategies in simulation. Under two-stage training, the four prompting methods achieve high in-distribution success but differ in their ability to use deictic masks in unseen layouts. Across methods, training-strategy ablations show that two-stage training improves such use, while retaining second-stage LI data mitigates forgetting without reducing VLI and VI performance. In three real-world tasks, one policy supports all modes. VLI and VI outperform LI under unseen expressions, appearance changes, and novel objects. For unseen categories, both achieve 100% success, compared with 16.7% for jointly trained LI. These results demonstrate the unified three-mode interface and guide DeicticVLA design.