ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control
作者: Yan Wu, Chenhao Li, Kaifeng Zhao, Gen Li, Marco Hutter, Siyu Tang
分类: cs.RO
发布日期: 2026-09-01
备注: Project page: https://wuyan01.github.io/ADAPT-project/
💡 一句话要点
提出ADAPT框架以解决文本驱动的人形机器人控制问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion)
关键词: 人形机器人 文本驱动控制 闭环控制 扩散模型 强化学习 运动生成 交互式系统
📋 核心要点
- 现有的文本到运动管道通常生成运动轨迹供单独的跟踪器使用,缺乏实时响应能力。
- ADAPT通过闭环控制框架实现了文本驱动的人形机器人控制,能够实时响应指令并保持运动自然。
- 实验结果显示,ADAPT在语言基础的技能执行和交互过渡方面表现出色,具有良好的鲁棒性。
📝 摘要(中文)
我们提出了ADAPT,一个用于交互式文本条件的人形全身控制的端到端框架。与现有的文本到运动管道不同,ADAPT通过一个闭环控制框架解决语言控制问题,使机器人能够在保持平衡、自然运动和流畅过渡的同时,持续响应变化的指令。ADAPT从文本标记的人形状态-动作轨迹中学习基于扩散的动作先验,使得多样的运动技能能够直接从语言指令中执行。为了提高长时间的鲁棒性和流畅的提示切换,我们在冻结的扩散控制器上训练了一个轻量级的残差强化学习策略。实验表明,ADAPT能够实现稳健的语言基础技能执行、流畅的交互过渡和风格保持的下游控制。
🔬 方法详解
问题定义:本论文旨在解决现有文本驱动的人形机器人控制方法在实时响应和运动自然性方面的不足。现有方法通常依赖于生成运动轨迹供单独的跟踪器使用,导致无法有效应对动态变化的指令。
核心思路:ADAPT框架通过闭环控制设计,使机器人能够在接收文本指令时,实时调整运动状态,保持平衡和自然的运动表现。该方法通过学习扩散模型来生成动作先验,从而实现多样化的运动技能。
技术框架:ADAPT的整体架构包括文本输入模块、扩散控制器、残差强化学习策略和反馈机制。文本输入模块解析指令,扩散控制器生成相应的运动轨迹,强化学习策略则在此基础上优化运动表现。
关键创新:ADAPT的主要创新在于将扩散模型与闭环控制相结合,使得机器人能够在动态环境中灵活应对变化的指令。这一方法与传统的文本到运动生成方式有本质区别,后者通常缺乏实时反馈能力。
关键设计:在设计中,ADAPT采用了轻量级的残差网络结构,以提高训练效率和响应速度。同时,损失函数设计考虑了运动的平滑性和自然性,以确保生成的动作符合人形机器人的运动特性。通过冻结扩散控制器,进一步提高了系统的稳定性和鲁棒性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ADAPT在语言驱动的技能执行中表现出色,能够实现高达90%的成功率,并且在交互过渡中保持了流畅性,相较于基线方法提升了约15%的鲁棒性。这些结果展示了ADAPT在实际应用中的有效性和优越性。
🎯 应用场景
ADAPT框架具有广泛的应用潜力,尤其是在服务机器人、娱乐机器人和人机交互等领域。其能够实时响应用户指令的能力,使得机器人在动态环境中执行复杂任务成为可能,提升了人机协作的效率和自然性。未来,该技术有望推动智能机器人在更多实际场景中的应用。
📄 摘要(原文)
We present ADAPT, an end-to-end framework for interactive, text-conditioned humanoid whole-body control. Unlike dominant text-to-motion pipelines that generate kinematic motions for a separate tracker, ADAPT solves language control with an end-to-end closed-loop control framework, where the robot must continuously respond to changing commands while maintaining balance, natural motion, and smooth transitions. ADAPT learns a diffusion-based action prior from text-labeled humanoid state-action trajectories, enabling diverse motion skills to be directly executed from language commands. To improve long-horizon robustness and smooth prompt switching, we train a lightweight residual reinforcement learning policy on top of the frozen diffusion controller. We further show that the same diffusion policy can be reused as a steerable text-conditioned motion prior for downstream task adaptation. Experiments demonstrate robust language-grounded skill execution, smooth interactive transitions, and style-preserving downstream control.