ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
作者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
分类: cs.RO, cs.AI
发布日期: 2026-08-19
备注: Project page: https://adept-dexterity.github.io/
💡 一句话要点
提出ADEPT框架以加速机器人灵巧性学习
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 机器人灵巧性 预训练 后训练 行为克隆 多指机器人 长时间任务
📋 核心要点
- 现有方法在多指机器人上学习新行为时面临挑战,尤其是在复杂任务的长时间执行中。
- ADEPT框架通过预训练和后训练相结合的方式,利用先前学习的行为来加速新技能的学习。
- 实验表明,ADEPT在两种不同的机器人平台上实现了人类水平的灵巧性,能够从困难的初始状态解决长时间任务。
📝 摘要(中文)
我们提出了加速灵巧性学习的框架ADEPT,这是一个大规模的强化学习(RL)框架,旨在通过原始的视觉-触觉感知学习可迁移的灵巧性,适用于高自由度(DoF)机器人。ADEPT首先在通用物体静置任务上预训练灵巧策略,然后利用该预训练行为作为先验进行下游策略的后训练。该框架能够学习新的行为,避免在每个新任务上重复学习相同的技能。预训练策略在下游任务的静置阶段实现零样本迁移,但简单的RL微调会迅速降低这一能力。为此,我们提出了一种稳定的后训练方案,结合行为克隆蒸馏、评论家预热和保守的在线更新。通过引入关节空间几何结构,ADEPT能够安全地利用完整的运动学灵巧性。
🔬 方法详解
问题定义:本论文旨在解决高自由度机器人在复杂任务中灵巧性学习的效率问题。现有方法往往需要从头开始学习每个新任务,导致重复性学习和效率低下。
核心思路:ADEPT通过在通用物体静置任务上进行预训练,建立一个灵巧策略的先验知识,然后在此基础上进行下游任务的后训练,从而加速新行为的学习。
技术框架:ADEPT的整体架构包括预训练阶段和后训练阶段。预训练阶段使用通用任务进行策略学习,后训练阶段则结合行为克隆蒸馏、评论家预热和保守的在线更新来优化策略。
关键创新:ADEPT的主要创新在于引入了稳定的后训练方案,解决了简单RL微调导致的能力下降问题。此外,关节空间几何结构的引入使得策略与机器人之间的交互更加高效。
关键设计:在设计中,采用了行为克隆蒸馏技术以提高学习效率,评论家预热用于增强策略的稳定性,同时在在线更新中引入保守策略以避免过拟合。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ADEPT在23 DoF的Kuka-Allegro和29 DoF的Flexiv-Sharpa机器人上实现了长时间任务的高效解决,且在复杂初始状态下的灵巧性达到了人类水平的速度,展示了显著的性能提升。
🎯 应用场景
ADEPT框架的潜在应用场景包括工业机器人、服务机器人以及医疗机器人等领域。通过提高机器人在复杂任务中的灵巧性,ADEPT能够显著提升自动化水平,降低人力成本,并在未来推动智能机器人技术的发展。
📄 摘要(原文)
We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception. ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task. The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: a 23 DoF Kuka-Allegro with two RGB cameras, and a 29 DoF Flexiv-Sharpa with two RGB cameras and five vision-based tactile sensors, and can solve long-horizon tasks from challenging initial states with dexterity at human-level speed.