SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

📄 arXiv: 2608.09771v1 📥 PDF

作者: Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

分类: cs.RO

发布日期: 2026-08-10

备注: 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/


💡 一句话要点

提出SLIM-0.5B以解决机器人操作中的动作预测问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 动作预测 自监督学习 多模态模型 流匹配 潜在变量

📋 核心要点

  1. 现有的视觉-语言-动作策略在处理连续机器人操作时,往往需要更紧凑的观察和动作表示,导致性能不足。
  2. SLIM通过自监督的掩码轨迹预测,学习基于动作的预测潜在变量,结合动作重建与未来潜在预测,提供了一种新的解决方案。
  3. 在多项模拟基准和实际评估中,SLIM在参数量、推理延迟和GPU内存使用上均优于现有的大型模型,展现出良好的性能。

📝 摘要(中文)

视觉-语言-动作策略依赖于大型多模态骨干网络,在每个控制步骤中联合执行感知、语言条件和动作生成。然而,现有方法在连续机器人操作中面临着对观察、动作及其引发的转变的紧凑表示的需求。SLIM(自监督潜在交互模型)是一种紧凑的0.5B参数潜在交互策略,学习基于动作的预测潜在变量,捕捉动作条件下的未来转变及解释观察变化的动作。SLIM通过自监督的掩码轨迹预测学习这些表示,结合动作重建与未来潜在预测。最终的策略通过流匹配进行训练,以实现语言条件的动作生成。实验表明,SLIM在模拟基准和现实世界评估中,与大型VLA和世界动作模型基线相比,参数更少、无额外的具身预训练、推理延迟更低且显著降低了GPU内存使用。

🔬 方法详解

问题定义:本论文旨在解决机器人操作中对观察、动作及其转变的紧凑表示的需求。现有方法往往依赖大型多模态模型,导致在连续操作中的效率低下和资源消耗过大。

核心思路:SLIM通过自监督学习的方式,利用掩码轨迹预测来学习动作条件下的潜在变量,旨在捕捉未来的状态转变及解释观察变化的动作,从而实现更高效的控制。

技术框架:SLIM的整体架构包括自监督掩码轨迹预测模块、动作重建模块和未来潜在预测模块。核心的Mixture-of-Transformers(MoT)骨干网络用于建模观察潜在变量与动作标记之间的交互。

关键创新:SLIM的主要创新在于其紧凑的0.5B参数设计,能够在不依赖额外的具身预训练的情况下,达到与大型模型相当的性能,显著降低了推理延迟和内存使用。

关键设计:SLIM采用了流匹配作为训练策略,结合了动作重建和未来潜在预测的损失函数设计,以确保模型在生成语言条件的动作时的准确性和高效性。其网络结构经过优化,以适应紧凑的参数设置。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SLIM在多项模拟基准和现实世界评估中表现出色,参数量仅为0.5B,推理延迟显著低于大型VLA和世界动作模型基线,同时GPU内存使用量大幅降低,展现出更高的效率和性能。

🎯 应用场景

SLIM的研究成果在机器人操作、自动化制造、智能家居等领域具有广泛的应用潜力。通过高效的动作预测和控制,SLIM能够提升机器人在复杂环境中的自主操作能力,推动智能机器人技术的发展。未来,SLIM还可能在其他多模态交互场景中发挥重要作用。

📄 摘要(原文)

Vision-language-action policies rely on large multimodal backbones to jointly perform perception, language conditioning, and action generation at every control step. Much of this capacity supports open-domain semantics, whereas continuous robot manipulation primarily requires compact representations of observations, actions, and the transitions induced by actions. Pixel-level world models provide another route, but predicting visual details irrelevant to control can be unnecessarily expensive. We propose SLIM (Self-supervised Latent Interaction Model), a compact 0.5B-parameter latent interaction policy. SLIM learns action-grounded predictive latents that capture both action-conditioned future transitions and the actions that explain observed changes. SLIM learns these representations through self-supervised masked trajectory prediction, combining action reconstruction with future-latent prediction. A compact Mixture-of-Transformers (MoT) backbone models interactions between observation latents and action tokens. The resulting policy is trained with flow matching for language-conditioned action generation. Across simulation benchmarks and real-world evaluation, SLIM matches or exceeds representative large-scale VLA and world-action-model baselines with fewer parameters, no additional embodied pretraining, lower inference latency, and substantially lower GPU memory usage.