$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

📄 arXiv: 2608.16885v1 📥 PDF

作者: Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

分类: cs.RO

发布日期: 2026-08-17

备注: 18 pages, 5 figures. Project page: https://tau0-vla.github.io/


💡 一句话要点

提出$τ_0$-VLA以解决长时间机器人操作中的决策问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间操作 层次化模型 机器人决策 世界模型 多模态训练 计算资源分配 智能机器人 任务生成

📋 核心要点

  1. 现有的层次化VLA模型在决策时仅依赖单次前向传递,无法有效处理复杂的决策场景。
  2. 本文提出$τ_0$-VLA模型,通过世界模型引导的测试时间计算,动态分配计算资源以优化决策过程。
  3. 实验表明,分配额外的计算资源显著提高了子任务预测的准确性,从而提升了长时间操作的成功率。

📝 摘要(中文)

长时间机器人操作要求机器人不仅可靠地执行单个技能,还需在扩展任务中连贯地排列这些技能。现有的层次化视觉-语言-动作(VLA)模型通常通过单次前向传递做出决策,缺乏为复杂或重要选择分配额外计算的机制。本文提出$τ_0$-VLA,一个层次化机器人基础模型,通过世界模型引导的测试时间计算,将高层子任务生成形式化为可计算扩展的推理问题。在每个推理步骤中,高层策略利用执行记忆生成子任务,并在必要时搜索替代方案。低层策略随后在多个机器人实例上执行生成的子任务。该策略在40,115小时的异构真实世界数据上进行训练,具有多模态共同训练。分布内和分布偏移设置下,分配额外的测试时间计算显著提高了下一个子任务预测的准确性,并且这些提升转化为长时间机器人操作任务的更高闭环成功率。

🔬 方法详解

问题定义:本文旨在解决长时间机器人操作中决策的复杂性,现有方法在处理重要选择时缺乏灵活的计算资源分配机制,导致性能不足。

核心思路:$τ_0$-VLA模型通过世界模型引导的测试时间计算,将高层子任务生成视为可扩展的推理问题,允许在推理过程中动态调整计算量,以应对复杂决策。

技术框架:该模型包括高层策略和低层策略两个主要模块。高层策略利用执行记忆生成子任务,并在必要时进行替代方案搜索;低层策略则负责在多个机器人实例上执行生成的子任务。

关键创新:最重要的创新在于将决策过程中的计算资源分配与任务复杂性相结合,使得模型能够在推理时灵活调整计算量,从而提高决策质量。

关键设计:模型在训练过程中使用了40,115小时的异构数据,采用多模态共同训练策略,确保高层和低层策略的有效协同。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,$τ_0$-VLA模型在分布内和分布偏移设置下,子任务预测准确性显著提高,具体提升幅度达到XX%(具体数据未知),并且在长时间机器人操作任务中,闭环成功率也有显著提升,证明了模型的有效性和实用性。

🎯 应用场景

$τ_0$-VLA模型在机器人操作、自动化制造、智能家居等领域具有广泛的应用潜力。通过提高机器人在复杂任务中的决策能力,该模型能够显著提升机器人在动态环境中的适应性和效率,推动智能机器人技术的发展。未来,该模型可能在更广泛的机器人任务中得到应用,进一步提升人机协作的智能化水平。

📄 摘要(原文)

Long-horizon robot manipulation requires a robot to both execute individual skills reliably and sequence them coherently over extended tasks. Most hierarchical vision-language-action (VLA) models make each such decision with a single forward pass, leaving no mechanism to allocate additional computation to difficult or consequential choices. We introduce $τ_0$-VLA, a hierarchical robot foundation model that formulates high-level subtask generation as a compute-scalable inference problem through world-model-guided test-time computation. At each inference step, the high-level policy uses execution memory to generate a subtask and, when needed, searches over alternatives before committing to its output. A low-level policy then executes the generated subtask across multiple robot embodiments. The policy is trained on 40,115 hours of heterogeneous real-world data with multimodal co-training. Across in-domain and distribution-shifted settings, allocating additional test-time computation substantially improves next-subtask prediction accuracy, and these gains translate into higher closed-loop success on long-horizon robot manipulation tasks.