NestDex: Nested Policy Learning with Copilot Assisted Teleoperation for Dexterous Manipulation
作者: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi
分类: cs.RO
发布日期: 2026-08-13
备注: 9 pages, 11 figures, 3 tables. Project website: https://aus.bot/research/nestdex
💡 一句话要点
提出NestDex以解决灵巧操作中的演示收集难题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 灵巧操作 嵌套策略学习 机器人控制 演示收集 视觉-语言选择
📋 核心要点
- 灵巧操作的学习受到一致且完整任务演示收集困难的限制,现有方法难以协调手臂与手指的精确动作。
- NestDex通过嵌套策略学习框架,利用学习到的手部技能辅助演示收集,简化了操作者的控制方式。
- 实验结果表明,NestDex在灵巧操作中提高了演示的可靠性和效率,支持有效的自主策略学习。
📝 摘要(中文)
灵巧操作能够显著增强机器人与物理世界的交互,但学习这些行为受到一致且完整任务演示收集困难的限制。与平行夹具操作不同,灵巧任务要求操作者在整个任务中协调手臂运动与精确的接触丰富的手指行为。本文提出NestDex,一个嵌套策略学习框架,通过使用学习到的手部技能来辅助演示收集,从而减轻这一负担。操作者通过单自由度离合器控制手臂并调节活跃的手部技能,而不是直接指定完整的手指轨迹。内层手部策略根据最新的本体感知历史调整其运动,同时视觉-语言选择器为每个任务阶段激活适当的技能。最终的演示训练一个独立的外层视觉运动策略,该策略在部署时控制手臂和手,而不依赖内层策略。手部动作变分自编码器提供紧凑的手部动作目标,同时保留关节空间中的手臂指令。通过真实世界的灵巧操作实验,NestDex提高了演示的可靠性和效率,实证评估支持有效的自主策略学习。
🔬 方法详解
问题定义:本文旨在解决灵巧操作中演示收集的困难,现有方法在协调手臂与手指的精确动作时存在显著挑战,导致演示不一致和不完整。
核心思路:NestDex通过嵌套策略学习框架,利用学习到的手部技能来辅助演示收集,操作者通过单自由度离合器控制手臂并调节手部技能,而不是直接指定手指轨迹,从而减轻了操作者的负担。
技术框架:NestDex的整体架构包括内层手部策略和外层视觉运动策略。内层策略根据本体感知历史调整手部动作,外层策略在部署时控制手臂和手。视觉-语言选择器用于激活适当的手部技能。
关键创新:NestDex的主要创新在于通过嵌套策略学习框架,将手部技能学习与演示收集相结合,显著提高了演示的可靠性和效率,与传统方法相比,减少了操作者的控制复杂性。
关键设计:关键设计包括单自由度离合器的使用、内层手部策略的本体感知调整、视觉-语言选择器的任务阶段激活,以及手部动作变分自编码器的紧凑目标生成。
🖼️ 关键图片
📊 实验亮点
实验结果显示,NestDex在真实世界的灵巧操作实验中显著提高了演示的可靠性和效率,具体表现为演示成功率提升了XX%(具体数据未知),并且在自主策略学习的有效性上得到了验证。
🎯 应用场景
NestDex的研究成果在机器人灵巧操作、自动化装配、医疗手术辅助等领域具有广泛的应用潜力。通过提高演示收集的效率和可靠性,该方法能够加速机器人学习复杂任务的能力,推动智能机器人在实际场景中的应用。
📄 摘要(原文)
Dexterous manipulation promises substantially richer robot interaction with the physical world, but learning these behaviours remains constrained by the difficulty of collecting consistent, complete-task demonstrations. Unlike parallel-jaw manipulation, dexterous tasks require the operator to coordinate arm motion with precise, contact-rich finger behaviour throughout the task. We introduce NestDex, a nested policy-learning framework that reduces this burden by using learned hand skills to assist demonstration collection. The operator controls the arm and regulates the active hand skill through a single-DoF clutch, rather than directly specifying the full finger trajectory. The inner hand policy adapts its motion from the latest proprioceptive history, while a vision-language selector activates the appropriate skill for each task stage. The resulting demonstrations train a separate outer visuomotor policy that controls both the arm and hand without the inner policies at deployment. A hand-action variational autoencoder provides compact hand-action targets while retaining arm commands in joint space. Across real-world dexterous manipulation experiments, NestDex improves demonstration reliability and efficiency, and the resulting empirical evaluations support effective autonomous policy learning. Video Demo are available at project website https://aus.bot/research/nestdex.