UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex
作者: Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding
分类: cs.RO
发布日期: 2026-08-18
💡 一句话要点
提出UniReflex以解决生成策略缺乏闭环力控制的问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 生成模仿学习 可变阻抗控制 闭环力调节 机器人操作 自适应门控机制
📋 核心要点
- 现有生成模仿学习策略在力调节方面存在不足,无法实现闭环控制,导致在实际应用中表现不佳。
- UniReflex通过引入可变阻抗控制,非侵入性地增强了冻结的生成策略,使其能够在不重新训练的情况下进行力调节。
- 实验证明,UniReflex在双手操作中显著提高了接触稳定性和成功率,且每步反向延迟比联合训练策略低25-66倍。
📝 摘要(中文)
生成模仿学习策略在轨迹规划方面表现优异,但在闭环力调节方面存在不足。本文提出了UniReflex,一个通用的即插即用框架,能够为冻结的生成策略提供可变阻抗控制(VIC),以实现接触调节。该方法通过在演示过程中收集的力-方向意图进行指导,无需进一步的慢骨干微调。UniReflex通过非侵入性地拦截深层潜在表示,驱动快速反射网络,将主动施力与外部交互响应解耦。实验表明,UniReflex显著提高了接触稳定性和成功率,同时保持了原有的位置信息准确性。
🔬 方法详解
问题定义:现有的生成模仿学习策略在轨迹规划上表现良好,但缺乏有效的闭环力调节能力,导致在与环境交互时的稳定性不足。
核心思路:UniReflex通过引入可变阻抗控制(VIC),使得冻结的生成策略能够在不进行重新训练的情况下,进行有效的力调节。该方法利用演示过程中收集的力-方向意图进行指导,增强了策略的适应性。
技术框架:UniReflex的整体架构包括一个快速反射网络,该网络从动作头部非侵入性地拦截深层潜在表示,并将主动施力与外部交互响应解耦。框架还集成了自适应门控机制,实现了位置主导规划与力主导执行之间的无缝切换。
关键创新:UniReflex的核心创新在于其非侵入性拦截深层潜在表示的能力,以及通过自适应门控机制实现的动态切换。这使得生成策略能够在不重新训练的情况下,灵活应对不同的任务需求。
关键设计:在设计中,UniReflex采用了规范化的各向异性刚度方向预测,以实现方向合规性分配。同时,关键参数设置和损失函数的设计也经过精心调整,以确保系统的稳定性和响应速度。
🖼️ 关键图片
📊 实验亮点
在双手操作的实验证明中,UniReflex显著提高了接触稳定性和成功率,且每步反向延迟比联合训练策略低25-66倍,展示了其在实际应用中的优越性能。
🎯 应用场景
UniReflex的研究成果在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过提升机器人在复杂环境中的接触稳定性,该框架能够显著提高任务执行的成功率,进而推动智能机器人技术的实际应用和发展。
📄 摘要(原文)
Generative imitation learning policies excel at trajectory planning but lack closed-loop force regulation, while directly incorporating force modalities often requires redesigning or retraining the network. We present UniReflex, a universal plug-and-play framework that equips frozen generative policies with variable impedance control (VIC) for contact regulation, guided by force-direction intent collected during demonstration, without further slow-backbone fine-tuning. By non-invasively intercepting deep latent representations from the action head, UniReflex drives a fast reflex network that decouples active force exertion from external interaction response. This scheme predicts normalized anisotropic stiffness directions for directional compliance allocation. Furthermore, UniReflex integrates an adaptive gating mechanism that enables seamless transitions between position-dominant planning and force-dominant execution. Real-world bimanual experiments demonstrate that UniReflex significantly improves contact stability and success rates while preserving original position accuracy. Our approach achieves 25-66x lower per-step backward latency relative to joint training strategies on the evaluated backbones.