Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models
作者: Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk
分类: cs.RO, cs.AI, cs.CL
发布日期: 2026-08-11
💡 一句话要点
提出SALT以解决视觉-语言-动作模型中的动作表示对齐问题
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作模型 动作表示 语义对齐 机器人控制 多模态学习
📋 核心要点
- 现有的视觉-语言-动作模型在动作表示上存在不足,主要依赖重建损失,导致语言信息的丢失。
- 论文提出SALT,通过引入辅助目标,使得视觉-语言模型能够从量化的动作潜变量中恢复指令,从而增强动作表示的语义信息。
- 实验结果显示,使用SALT的策略在SimplerEnv中取得71.9%的成功率,显著高于传统方法,表明其在语言条件控制中的有效性。
📝 摘要(中文)
动作动词不仅描述动作的物理结果,还反映动作的执行方式。然而,现有的视觉-语言-动作模型中的动作表示通常仅通过L1/L2损失在原始动作空间中进行优化,这种数值接近性并不一定反映语言上有意义的区别。通过在BridgeV2上进行实验,我们发现动作轨迹包含超出视觉状态变化的动词基础信息,而仅依赖重建的离散标记化会系统性地削弱这些信息。为了解决这一问题,我们提出了SALT(语义对齐动作标记器),它通过一个辅助目标增强了VQ-VAE风格的标记器,要求冻结的视觉-语言模型从量化的动作潜变量中恢复情节指令。使用SALT训练的策略在SimplerEnv中实现了71.9%的平均成功率,相比之下,仅重建的VQ-VAE标记器为42.7%,FAST为31.2%。SALT还在保持重建保真度的同时开发了动词专用代码。这些结果表明,机器人动作轨迹为语言基础提供了一个来源,保持这种结构在动作表示中可以显著改善基于语言的控制。
🔬 方法详解
问题定义:论文要解决的问题是现有视觉-语言-动作模型在动作表示中缺乏语义对齐,导致重要的语言信息丢失。现有方法主要依赖重建损失,无法有效捕捉动作的语义特征。
核心思路:论文的核心思路是引入SALT,一个语义对齐的动作标记器,通过辅助目标使得视觉-语言模型能够从量化的动作潜变量中恢复指令,从而增强动作表示的语义信息。
技术框架:整体架构包括一个VQ-VAE风格的标记器和一个冻结的视觉-语言模型。标记器负责将动作表示量化,而视觉-语言模型则通过辅助目标进行指令恢复。
关键创新:最重要的技术创新点在于SALT的设计,它不仅关注重建,还强调语义对齐,确保动作表示能够保留语言信息。这与现有方法的重建导向形成鲜明对比。
关键设计:在参数设置上,SALT使用了量化动作潜变量的辅助目标,损失函数结合了重建损失和语义对齐损失,确保在保持重建保真度的同时,增强了动词专用代码的生成。具体的网络结构细节尚未明确,但强调了与视觉-语言模型的交互。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用SALT训练的策略在SimplerEnv中实现了71.9%的平均成功率,相较于仅依赖重建的VQ-VAE标记器的42.7%和FAST的31.2%,提升幅度显著。这表明SALT在语言条件控制中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动化系统和人机交互等。通过增强动作表示的语义对齐,SALT可以提高机器人在复杂环境中的自主决策能力,提升人机协作的效率和准确性。未来,这一方法可能推动智能机器人在多模态理解和执行任务中的应用。
📄 摘要(原文)
Action verbs describe not only the physical outcomes of actions, but also how those actions are performed. Yet action representations in vision-language-action models (VLAs) are typically optimized for reconstruction under L1/L2 losses in raw action space, where numerical proximity need not reflect linguistically meaningful distinctions. On BridgeV2, we show that action trajectories contain verb-grounding information beyond visual state changes, and that reconstruction-only discrete tokenization systematically erodes this information. To address this problem, we introduce SALT, a Semantically ALigned action Tokenizer that augments a VQ-VAE-style tokenizer with an auxiliary objective requiring a frozen vision-language model to recover the episode instruction from quantized action latents. Policies trained with SALT achieve 71.9% average success in SimplerEnv, compared with 42.7% for a reconstruction-only VQ-VAE tokenizer and 31.2% for FAST. SALT also develops verb-specialized codes while maintaining reconstruction fidelity. These results show that robot action trajectories provide a source of language grounding and that preserving this structure in action representations can substantially improve language-conditioned control.