Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies

📄 arXiv: 2608.03727v1 📥 PDF

作者: Chenyi Wang, Xinkai Wang, Bokai Lin, Jialin Tian, Fucheng Zhang, Cewu Lu, Lixin Yang

分类: cs.RO

发布日期: 2026-08-04

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Track4Action以解决3D跟踪与视觉语言行动政策的对齐问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言行动 3D跟踪 机器人控制 深度学习 多模态学习

📋 核心要点

  1. 现有的视觉语言行动政策缺乏对3D世界变化的理解,导致机器人命令的执行效果不佳。
  2. Track4Action框架通过从3D跟踪器中提取转变信息,构建了更为精准的VLA政策,提升了对齐能力。
  3. 在多个实验中,Track4Action在零样本LIBERO-Plus上达到了82.3%的准确率,显著优于对齐无关的变体。

📝 摘要(中文)

现有的视觉语言行动(VLA)政策虽然能够通过动作标签指导机器人命令的模仿,但缺乏对这些命令如何改变3D世界的理解。为了解决这一问题,Track4Action框架通过从静态的世界中心3D跟踪器中提取转变信息,构建了当前观察的VLA政策。在训练过程中,Track4World将包含K帧过渡的演示片段编码为跟踪器特征,通过可学习的跟踪查询从当前VLA隐藏状态中推断该特征,并在共享空间中进行匹配。实验结果显示,Track4Action在多个任务上显著提升了性能,证明了3D跟踪器特征在无跟踪器VLA部署中的重要性。

🔬 方法详解

问题定义:本论文旨在解决现有视觉语言行动(VLA)政策在执行机器人命令时缺乏对3D世界变化理解的问题。现有方法无法有效利用3D跟踪信息,导致机器人在执行任务时的表现不理想。

核心思路:Track4Action框架通过从静态的世界中心3D跟踪器中提取转变信息,构建当前观察的VLA政策。这一设计使得VLA政策能够更好地理解和适应3D环境的变化。

技术框架:整体架构包括两个主要模块:Track4World用于编码包含K帧过渡的演示片段为跟踪器特征,和可学习的跟踪查询模块用于从当前VLA隐藏状态中推断该特征并进行匹配。

关键创新:最重要的创新在于将3D跟踪器特征作为对齐目标,而在部署时不使用演示片段或跟踪器本身。这种方法有效地提升了VLA政策的执行能力。

关键设计:在模型设计中,采用了可学习的跟踪查询来推断特征,并通过特征门控机制来调节流匹配的动作头。损失函数和网络结构经过精心设计,以确保模型在训练过程中的有效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Track4Action在零样本LIBERO-Plus上达到了82.3%的准确率,相较于对齐无关的变体提升了7.6个百分点,同时在RoboTwin 2.0的干净和随机分割上分别获得了80.44%和81.48%的成绩,显示出显著的性能提升。

🎯 应用场景

Track4Action的研究成果在机器人控制、自动化任务执行和人机交互等领域具有广泛的应用潜力。通过提升机器人对环境变化的理解能力,该框架能够在复杂的动态场景中实现更高效的任务执行,推动智能机器人技术的发展。

📄 摘要(原文)

Action labels tell a vision-language-action (VLA) policy which robot commands to imitate, but not how those commands change the 3D world. The aligned demonstration clip contains this missing supervision because its $K$ frame transitions record the geometry, motion, visibility, and camera change produced during the corresponding $K$ actions. We introduce Track4Action, a framework that distills this realized transition from a frozen world-centric 3D tracker into a current-observation VLA policy. During training, Track4World encodes the clip $V_{t:t+K}$ into a pooled tracker feature. Learnable track queries infer this feature from current VLA hidden states, match it in a shared space, and condition a flow-matching action head through a feature-wise gate. The tracker feature only defines the alignment target, so neither the clip nor the tracker is used at deployment. Track4Action reaches 82.3% on zero-shot LIBERO-Plus, improving the alignment-free variant by 7.6 points and LaMP by 3.0 points. It obtains 80.44% and 81.48% on the clean and randomized RoboTwin 2.0 splits, and 67.5% average success across four physical bimanual tasks, 25.0 points above the alignment-free variant. The gains across simulation and physical tasks support action-aligned 3D tracker features as privileged supervision for tracker-free VLA deployment. Our project page is available at https://wing0night.github.io/track4action-project-page.