Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

📄 arXiv: 2608.09410v1 📥 PDF

作者: Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

分类: cs.RO

发布日期: 2026-08-10

备注: 9 pages, 4 figures, and 3 tables


💡 一句话要点

提出HyMeS框架以解决机器人操控中的记忆依赖问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操控 记忆管理 混合学习 视觉-语言-动作 模仿学习 启发式学习 数据效率 多模态验证

📋 核心要点

  1. 现有的VLA策略在处理长期记忆依赖的操控任务时存在局限,无法有效利用历史信息。
  2. HyMeS框架结合了低级运动技能的模仿学习与高级记忆管理的启发式学习,提升了操控能力。
  3. 在RoboMemArena上,HyMeS的平均累计成功率从52.5%提升至66.2%,任务成功率从41.3%提升至60.1%。

📝 摘要(中文)

现代视觉-语言-动作(VLA)策略已获得广泛的操控技能,但通常仅基于当前观察或短期历史生成每个动作。然而,现实世界的操控往往是非马尔可夫的,机器人需要保留和推理与任务相关的长期交互历史信息以决定下一步动作。为了解决这一挑战,本文提出了HyMeS,一个混合学习框架,利用编码代理的推理和记忆管理能力来引导马尔可夫VLA进行记忆依赖的操控。HyMeS通过基于梯度的模仿学习学习低级运动技能,同时编码代理通过迭代更新可执行启发式系统来获取高级记忆管理策略。通过多模态阶段完成验证,我们将引导与执行闭环,使用本体信号和多帧VLM判断更新记忆。与端到端的记忆增强VLA相比,HyMeS仅需对可重用的运动技能进行演示,从而实现数据高效的组合泛化。

🔬 方法详解

问题定义:本文旨在解决机器人操控中对长期记忆依赖的挑战,现有方法通常无法有效处理非马尔可夫性任务,导致性能下降。

核心思路:HyMeS框架通过结合低级运动技能的模仿学习与高级记忆管理的启发式学习,提升了机器人在复杂操控任务中的表现。这样的设计使得机器人能够在执行任务时更好地利用历史信息。

技术框架:HyMeS的整体架构包括两个主要模块:低级运动技能学习模块和高级记忆管理模块。前者通过模仿学习获取运动技能,后者通过反馈迭代更新记忆管理策略。整个流程通过多模态验证实现闭环。

关键创新:HyMeS的主要创新在于将编码代理的推理能力与VLA策略结合,形成了一种新的混合学习框架。这种方法与传统的端到端记忆增强VLA相比,显著提高了数据效率和任务成功率。

关键设计:在参数设置上,HyMeS采用了基于梯度的模仿学习损失函数,同时在记忆管理模块中引入了可执行启发式系统的反馈机制,以优化记忆更新过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

HyMeS在RoboMemArena上的实验结果显示,平均累计成功率从52.5%提升至66.2%,任务成功率从41.3%提升至60.1%。此外,HyMeS在累计成功率上比PrediMem高出4.5个百分点,任务成功率高出14.5个百分点,展现了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、工业自动化和智能家居等场景。在这些领域,机器人需要处理复杂的操控任务并有效利用历史信息,从而提高工作效率和准确性。未来,HyMeS框架可能推动更智能的机器人系统的开发,使其在动态环境中表现更为出色。

📄 摘要(原文)

Modern vision-language-action (VLA) policies have acquired broad manipulation skills, but typically generate each action chunk from the current observation or a short fixed-length history. However, real-world manipulation is often non-Markovian, requiring robots to retain and reason over task-relevant information from long-horizon interaction histories to determine the next action. To address this challenge, we propose HyMeS, a hybrid learning framework that leverages the reasoning and memory-management capabilities of coding agents to steer a Markovian VLA for memory-dependent manipulation. Specifically, HyMeS learns low-level motor skills through gradient-based imitation learning, while a coding agent acquires high-level memory-management strategies through heuristic learning by iteratively updating an executable heuristic system from rollout feedback. Furthermore, we close the loop between steering and execution through multimodal stage-completion verification, which updates memory using proprioceptive signals and multi-frame VLM judgments. Compared with end-to-end memory-augmented VLAs, HyMeS requires demonstrations only for reusable motor skills rather than for every history-dependent task configuration, enabling data-efficient compositional generalization. On RoboMemArena, HyMeS improves mean cumulative success from 52.5% to 66.2% and mean task success from 41.3% to 60.1% over pi0.5, while outperforming PrediMem by 4.5 points in cumulative success and 14.5 points in task success.