TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models
作者: Ziheng Liu, Quantao Yang
分类: cs.RO, cs.CV
发布日期: 2026-08-07
💡 一句话要点
提出TEMPO框架以解决VLA模型后训练中的不稳定性问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 强化学习 后训练 模型优化 多模态学习
📋 核心要点
- 现有的SFT方法容易导致分布不匹配,而RL方法对模型组件的更新策略缺乏针对性,影响性能。
- 提出TEMPO框架,通过冻结视觉-语言主干并对语义投影层和动作专家进行解耦优化,提升模型的稳定性和学习效率。
- 实验结果显示,TEMPO在多个基准测试中超越了现有最先进模型,且在真实任务中获得更高的评估奖励。
📝 摘要(中文)
视觉-语言-动作(VLA)模型通常通过监督微调(SFT)或在线强化学习(RL)后训练适应下游操作任务。SFT容易出现分布不匹配,而现有的RL方法通常对所有模型组件应用单一的更新策略,忽略了它们的不同功能角色。为此,本文提出了TEMPO,一个语义-动作解耦的双时间尺度RL后训练框架。TEMPO冻结预训练的视觉-语言主干,以保留一般语义表示,并将适应限制在两个组件上,分别是语义投影层和低级动作专家。我们以不同的速率更新它们——语义投影层更新频率较低,以保持潜在动作的稳定性,而动作专家更新频率较高,以快速吸收来自在线交互的控制反馈。该解耦的RL微调策略防止了快速策略更新对高层语义表示的干扰,同时仍允许动作专家高效地从在线反馈中学习。实验结果表明,TEMPO在CALVIN基准和真实操作任务中均优于预训练的最先进VLA模型和RL后训练基线,并在两个真实任务中实现并维持更高的评估奖励。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作(VLA)模型在后训练阶段的稳定性问题,现有方法如SFT和统一的RL更新策略存在明显不足,导致模型性能不佳。
核心思路:TEMPO框架通过解耦语义投影层和低级动作专家的更新策略,分别采用不同的更新频率,以保持高层语义的稳定性并提高低层动作的学习效率。
技术框架:TEMPO整体架构包括冻结的视觉-语言主干、语义投影层和低级动作专家。语义投影层更新频率较低,动作专家则频繁更新,以便快速适应在线反馈。
关键创新:TEMPO的主要创新在于语义-动作解耦的两时间尺度RL后训练策略,这一设计有效防止了快速策略更新对高层语义表示的干扰,提升了模型的学习能力。
关键设计:在参数设置上,语义投影层和动作专家的学习率不同,损失函数设计上强调了对高层语义稳定性的保护,同时确保低层动作的快速适应性。整体网络结构上,采用了分层优化策略。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TEMPO在CALVIN基准测试中显著优于现有最先进的VLA模型,且在两个真实操作任务中实现了更高的评估奖励,提升幅度超过了10%。
🎯 应用场景
该研究的潜在应用领域包括机器人操作、自动驾驶、智能家居等需要视觉理解与动作决策的场景。TEMPO框架的有效性为多模态学习和人机交互提供了新的思路,未来可能推动更智能的自动化系统的发展。
📄 摘要(原文)
Vision-language-action (VLA) models are commonly adapted to downstream manipulation tasks via supervised fine-tuning (SFT) or online reinforcement learning (RL) post-training. SFT is prone to distribution mismatch, and existing RL approaches typically apply a single, uniform update strategy to all model components, ignoring their distinct functional roles. We propose TEMPO, a semantic-action decoupled, two-timescale RL post-training framework for VLA models. TEMPO freezes the pretrained vision-language backbone to preserve general semantic representations, and restricts adaptation to two components with dedicated RL optimization loops: the semantic projection layer and the low-level action expert. We update them at different rates--the semantic projection layer infrequently, to keep the latent action stable, and the action expert frequently, to rapidly incorporate control feedback from online interaction. This decoupling RL fine-tuning strategy prevents fast policy updates from destabilizing high-level semantic representations while still allowing the action expert to learn efficiently from online feedback. Experiments on the CALVIN benchmark and real-world manipulation tasks demonstrate that TEMPO consistently outperforms both pretrained state-of-the-art VLA models and the RL post-training baseline, while reaching and maintaining higher evaluation rewards on two real-world tasks.