SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

📄 arXiv: 2608.05970v1 📥 PDF

作者: Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

分类: cs.RO, cs.AI

发布日期: 2026-08-06


💡 一句话要点

提出SkillMemo框架以解决机器人操作中的技能记忆问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 具身视觉 机器人操作 技能记忆 组合泛化 轨迹分割 动态记忆库 混合专家

📋 核心要点

  1. 现有的具身视觉运动模型在组合泛化能力上存在不足,尤其是在缺乏大规模数据集的情况下,无法有效捕捉可重用的技能结构。
  2. 本文提出的SkillMemo框架通过专家指导的轨迹分割模块,将长时间演示隐式分解为原子技能,并整合到动态记忆库中以解决组合任务。
  3. 实验结果显示,SkillMemo在仿真和真实操作任务中均提升了DP和VLA的性能,超越了基线模型$π_{0.5}$,展现出强大的组合泛化能力。

📝 摘要(中文)

具身视觉运动模型(如扩散策略和视觉-语言-动作模型)在机器人操作基准测试中表现出色,但由于缺乏大规模的具身轨迹数据集,其潜力受到限制,导致在分布外场景中的组合泛化能力不足。为了解决这一问题,本文提出了SkillMemo框架,该框架通过隐式分解长时间演示为潜在原子技能,并将技能级特征整合到动态情节记忆库中,以解决组合任务。具体而言,首先引入基于专家指导的轨迹分割模块,利用混合专家架构将轨迹隐式划分为不同的技能原语。然后设计了一个技能级情节记忆架构,存储可检索的紧凑技能表示。在推理过程中,记忆库检索最相关的技能原语,并与模型当前的门控分布融合,从而提供强大的上下文先验以优化动作预测。大量实验表明,SkillMemo在仿真基准和真实世界操作任务中均显著提升了DP和VLA的性能,达到了最先进的水平。

🔬 方法详解

问题定义:本文旨在解决现有具身视觉运动模型在组合任务中的泛化能力不足的问题,尤其是在缺乏大规模具身轨迹数据集的情况下,导致无法有效捕捉和重用技能结构。

核心思路:SkillMemo框架通过专家指导的轨迹分割模块,将长时间演示隐式分解为原子技能,并将这些技能整合到动态情节记忆库中,以便在推理时能够检索和融合相关技能,从而优化动作预测。

技术框架:SkillMemo的整体架构包括轨迹分割模块和技能级情节记忆模块。轨迹分割模块利用混合专家架构将轨迹分割为技能原语,而情节记忆模块则存储这些技能的紧凑表示,便于在推理时进行检索和融合。

关键创新:最重要的创新在于引入了专家指导的轨迹分割机制和动态记忆库的设计,使得模型能够在推理过程中有效地利用历史技能信息,从而提升组合任务的性能。

关键设计:在设计中,采用了混合专家架构来实现轨迹的分割,并通过学习门控系数来表示不同技能原语的权重。此外,情节记忆模块使用键值对的形式存储技能表示,以便快速检索和融合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SkillMemo在仿真基准和真实操作任务中均显著提升了DP和VLA的性能,达到了最先进的水平,超越了基线模型$π_{0.5}$,展示了强大的组合泛化能力。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动化制造和人机交互等。通过提升机器人在复杂任务中的技能记忆和泛化能力,SkillMemo框架能够显著提高机器人在动态环境中的适应性和效率,推动智能机器人技术的发展。

📄 摘要(原文)

Embodied visuomotor models, including Diffusion Policy (DP) and Vision-Language-Action (VLA) models, have demonstrated promising performance on robotic manipulation benchmarks. However, their potential remains fundamentally constrained by the scarcity of large-scale embodied trajectory datasets, leading to insufficient compositional generalization in out-of-distribution (OOD) scenarios with limited capability to capture reusable skill structures. To address this limitation, we propose Skill-Based Memory (SkillMemo) framework that implicitly decomposes long-horizon demonstrations into latent atomic skills and integrates skill-level features into a dynamic episodic memory bank for solving compositional tasks. Specifically, we first introduce an expert-guided trajectory segmentation module built upon a Mixture-of-Experts (MoE) architecture, which implicitly partitions trajectories into distinct skill primitives represented by learned gating coefficients. We further design a skill-level episodic memory architecture that stores compact skill representations as retrievable key-value pairs. During inference, the memory bank retrieves the most relevant skill primitives which are subsequently fused with the model's current gating distribution, providing a robust contextual prior to refine action predictions. Extensive experiments on the simulation benchmark and real-world manipulation tasks demonstrate that SkillMemo consistently enhances both DP and VLA backbones, achieving state-of-the-art performance and outperforming $π_{0.5}$, while exhibiting strong compositional generalization to unseen task configurations.