V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models
作者: Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li
分类: cs.CV
发布日期: 2026-08-26
💡 一句话要点
提出V-Link以解决VLA模型中视觉表示丢失问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 机器人操作 特征转移 空间查询 语义查询
📋 核心要点
- 现有的视觉-语言-动作模型在动作专家对3D几何和2D语义信息的访问上存在显著限制,导致感知基础薄弱。
- V-Link通过在视觉-语言到动作特征转移过程中显式恢复视觉表示,学习互补的空间和语义查询表示。
- 在多个基准测试中,V-Link显著提高了模型的成功率,尤其在真实世界任务中表现出色。
📝 摘要(中文)
视觉-语言-动作(VLA)模型通过整合视觉感知、语言理解和连续动作控制,为通用机器人操作提供了可扩展的路径。然而,我们揭示了VLA架构的一个关键限制:动作专家对VLM特征中的3D几何和2D语义信息的访问有限。这一可访问性差距削弱了感知基础,限制了精细机器人操作的性能。为了解决这一问题,我们提出了V-Link,该方法在视觉-语言(VL)到动作(A)特征转移过程中显式恢复视觉表示。具体而言,V-Link在VLM中学习互补的空间和语义查询表示,并通过不对称路径将其注入到动作DiT中。我们的V-Link在LIBERO、LIBERO-Plus和RoboTwin 2.0上的平均成功率分别比基础模型GR00T N1.6提高了+1.9%、+31.2%和+18.8%。在AGIBOT A3 Ultra上,V-Link在两个真实世界的人形任务中进一步实现了+20%和+24%的提升。
🔬 方法详解
问题定义:本论文旨在解决视觉-语言-动作(VLA)模型中动作专家对3D几何和2D语义信息访问有限的问题。现有方法在感知基础上存在显著不足,影响了精细机器人操作的性能。
核心思路:V-Link的核心思路是通过显式恢复视觉表示,学习互补的空间和语义查询表示,并将其注入到动作生成过程中,以增强动作专家的感知能力。
技术框架:V-Link的整体架构包括两个主要模块:空间查询和语义查询。空间查询提供几何条件,而语义查询则补充原始的VLM图像标记。这些查询通过不对称路径注入到动作DiT中,从而实现特征的有效转移。
关键创新:V-Link的主要创新在于其通过学习互补的查询表示来显式恢复视觉信息,这与传统方法的直接特征转移方式有本质区别。
关键设计:在设计上,V-Link采用了特定的损失函数来优化空间和语义查询的学习过程,同时在网络结构上进行了调整,以确保查询信息能够有效地与动作生成模块结合。
🖼️ 关键图片
📊 实验亮点
V-Link在多个基准测试中表现出色,特别是在LIBERO-Plus上成功率提升达+31.2%,在AGIBOT A3 Ultra的真实任务中分别实现了+20%和+24%的提升,显示出其在实际应用中的显著优势。
🎯 应用场景
该研究的潜在应用领域包括机器人操作、自动化制造和人机交互等。通过提升机器人在复杂环境中的操作能力,V-Link有望在实际应用中实现更高的效率和灵活性,推动智能机器人技术的发展。
📄 摘要(原文)
Vision-language-action (VLA) models provide a scalable path toward generalist robotic manipulation by integrating visual perception, language understanding, and continuous action control. However, we reveal a critical limitation of VLA architectures: the action expert has limited access to the 3D geometric and 2D semantic information available in VLM features. This accessibility gap weakens perceptual grounding and limits performance on fine-grained robotic manipulation. To address this issue, we propose V-Link, which explicitly recovers visual representations during the vision-language (VL) to action (A) feature transfer. Specifically, V-Link learns complementary Spatial and Semantic Query representations within the VLM and injects them into Action DiT through asymmetric pathways. Semantic Queries complement the original VLM image tokens, whereas Spatial Queries provide dedicated geometric conditioning for spatially grounded action generation. Across LIBERO, LIBERO-Plus, and RoboTwin 2.0, our V-Link improves the average success rate over base model GR00T N1.6 by +1.9%, +31.2%, and +18.8%, respectively. On the AGIBOT A3 Ultra, V-Link further achieves gains of +20% and +24% on two real-world humanoid tasks.