AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
作者: Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu
分类: cs.RO, cs.CV
发布日期: 2026-08-07
💡 一句话要点
提出AtlasVLA以解决视觉-语言-动作模型的反应性限制问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 持久状态建模 主动推理 空间推理 机器人技术
📋 核心要点
- 现有的视觉-语言-动作模型在处理部分可观察和长时间任务时,因反应性设计而面临性能瓶颈。
- 本文提出AtlasVLA框架,通过持久的世界-自我状态实现主动推理,克服感知遗忘和任务进度遗忘问题。
- 在LIBERO、RLBench和真实世界基准测试中,AtlasVLA在仅使用手腕相机的情况下,显著提升了性能,尤其在长时间任务中表现优异。
📝 摘要(中文)
尽管视觉-语言-动作(VLA)模型在具身人工智能方面取得了进展,但其根本的反应性范式在部分可观察和长时间任务中严重限制了性能。由于仅依赖单个手腕-mounted相机,它们不可避免地会在物体离开视野时遭遇感知遗忘,以及在多步骤执行过程中出现的任务进度遗忘。为了解决这些瓶颈,本文提出了AtlasVLA,一个通过持久的世界-自我状态实现从直接反应操控到主动推理的框架。AtlasVLA具有双重记忆架构:4D持久世界状态记忆将瞬态2D观察提升为全球更新的体素哈希空间状态,以解决视觉盲点,以及跟踪历史自我状态和任务进度的自我工作状态记忆。通过将扩散变换器(DiT)条件化于这一联合世界-自我状态,AtlasVLA实现了稳健的空间推理。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作模型在部分可观察和长时间任务中因反应性设计导致的性能限制,特别是感知遗忘和任务进度遗忘的问题。
核心思路:AtlasVLA通过引入持久的世界-自我状态,转变为主动推理的方式,提升了模型在复杂环境中的空间推理能力。
技术框架:AtlasVLA采用双重记忆架构,包括4D持久世界状态记忆和自我工作状态记忆。前者将瞬态2D观察转化为全球更新的空间状态,后者则跟踪历史自我状态和任务进度。
关键创新:AtlasVLA的主要创新在于其双重记忆架构,能够有效解决视觉盲点和任务进度遗忘,与传统的反应性模型相比,显著提升了推理能力。
关键设计:在设计中,4D持久世界状态记忆采用体素哈希技术,确保空间状态的高效更新;自我工作状态记忆则通过历史数据的跟踪,增强了模型的任务执行能力。
🖼️ 关键图片
📊 实验亮点
AtlasVLA在LIBERO-Long和真实世界长时间任务中,分别实现了9.4%和17.5%的绝对成功率提升,显著优于多视角基线,展示了其在复杂任务中的卓越性能。
🎯 应用场景
AtlasVLA的研究成果在多个领域具有潜在应用价值,包括智能机器人、自动驾驶、虚拟现实等。通过提升模型在复杂环境中的推理能力,能够更好地支持人机协作和自主决策,推动具身人工智能的发展。
📄 摘要(原文)
While Vision-Language-Action (VLA) models have advanced embodied AI, their fundamentally reactive paradigm severely limits performance in partially observable and long-horizon tasks. When restricted to a single wrist-mounted camera, they inevitably suffer from perception forgetting as objects exit the field of view, and temporal task-progress forgetting} during multi-step execution. To overcome these bottlenecks, we propose AtlasVLA, a novel framework that transitions from direct reactive manipulation to proactive reasoning through a persistent world-ego state. AtlasVLA features a dual-memory architecture: a 4D Persistent World State Memory that lifts transient 2D observations into a globally updated, voxel-hashed spatial state to resolve visual blind spots, and an Ego-Working State Memory that tracks historical ego state and task progress. By conditioning a diffusion transformer (DiT) on this joint World-Ego state, AtlasVLA enables robust spatial reasoning. Extensive evaluations across LIBERO, RLBench, and real-world benchmarks demonstrate that AtlasVLA achieves state-of-the-art performance using solely a wrist camera. Remarkably, it decisively outperforms multi-view baselines, yielding absolute success rate improvements of 9.4% on LIBERO-Long and 17.5% in real-world long-horizon tasks.