EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning
作者: Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu
分类: cs.RO
发布日期: 2026-08-04
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出EvoHIL以解决人机协同强化学习中的动态适应问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 人机协同强化学习 自我演化奖励 动作流稳定化 视觉适应 机器人操作 动态环境 离线微调
📋 核心要点
- 现有的人机协同强化学习方法在动态环境中表现不佳,面临奖励模型失效、动作不一致和视觉策略敏感等挑战。
- EvoHIL通过自我演化奖励、动作流稳定化和保留感知的离线微调等模块,提供了一种适应性强的学习框架。
- 在六个操作任务的实验中,EvoHIL显著提高了任务成功率和运动平滑度,表现优于传统基线方法。
📝 摘要(中文)
人机协同强化学习(HIL-RL)使机器人能够通过有限的真实世界交互学习接触丰富的操作,但在部署中暴露出三个相互关联的局限性:静态视觉奖励模型在场景变化下失效;独立采样的动作导致时间上不一致的运动;基于视觉的策略对外观变化敏感。我们提出了EvoHIL,一个统一框架,通过分阶段的人机协同学习过程,适应奖励模型、动作生成器和视觉领域。首先,自我演化奖励(SER)从人类确认的正样本和临时弱负样本中调整成功分类器。其次,动作流稳定化(AFS)通过流匹配生成时间一致的动作块,将策略更新与执行的动作前缀和示范行为相结合。最后,保留感知的离线微调重放重新点亮交互数据,同时将AFS演员-评论家锚定到先前行为,适应视觉领域而无需额外的机器人交互。在控制光照变化下的六个操作任务中,EvoHIL相较于人机协同和模仿基线提高了任务成功率、与人类确认标签的一致性、运动平滑度和完成时间。
🔬 方法详解
问题定义:本论文旨在解决人机协同强化学习中动态环境下的适应性问题,现有方法在场景变化时奖励模型失效,导致机器人学习效果不佳。
核心思路:EvoHIL通过自我演化奖励和动作流稳定化等机制,使得机器人能够在变化的环境中持续优化其学习策略,提升学习的鲁棒性。
技术框架:EvoHIL的整体架构包括三个主要模块:自我演化奖励(SER)、动作流稳定化(AFS)和保留感知的离线微调。SER根据人类反馈动态调整奖励模型,AFS确保动作的时间一致性,而离线微调则在不增加额外交互的情况下优化视觉领域。
关键创新:EvoHIL的核心创新在于将奖励模型、动作生成和视觉领域的适应性整合为一个统一的框架,解决了现有方法在动态环境中的局限性。
关键设计:在SER中,成功分类器通过人类确认的正样本和弱负样本进行训练;AFS通过流匹配生成一致的动作块;离线微调则利用重放机制优化模型,确保与先前行为的一致性。具体的损失函数和网络结构设计在论文中有详细描述。
🖼️ 关键图片
📊 实验亮点
在六个操作任务的实验中,EvoHIL在任务成功率、与人类确认标签的一致性、运动平滑度和完成时间等方面均表现出显著提升,具体成功率提高了XX%,运动平滑度提升了YY%。这些结果表明EvoHIL在实际应用中具有较强的优势。
🎯 应用场景
EvoHIL的研究成果在机器人操作、自动化制造和人机协作等领域具有广泛的应用潜力。通过提升机器人在动态环境中的学习能力,该方法能够促进更智能的机器人系统在复杂任务中的应用,推动智能制造和服务机器人等行业的发展。
📄 摘要(原文)
Human-in-the-loop reinforcement learning (HIL-RL) enables robots to learn contact-rich manipulation from limited real-world interaction, but deployment exposes three coupled limitations: static visual reward models fail under scene changes; independently sampled actions cause temporally inconsistent motion; and vision-based policies remain sensitive to appearance shifts. We present EvoHIL, a unified framework that adapts the reward model, action generator, and visual do main within a staged human-in-the-loop learning process. First, self-evolving reward (SER) adapts the success classifier from human-confirmed positives and provisional weak negatives. Second, Action Flow Stabilization (AFS) generates temporally coherent action chunks through flow matching, grounding policy updates in executed action prefixes and demonstrated behavior. Third, retention-aware offline fine-tuning replays relit interaction data while anchoring the AFS actor-critic to prior behavior, adapting the visual domain without additional robot interaction. Across six manipulation tasks on Franka FR3 and SO-101 arms under a controlled lighting shift, EvoHIL improves task success, agreement with human-confirmation labels, motion smoothness, and completion time relative to human-in-the-loop and imitation baselines.Project page: https://anonymous4366.github.io/EvoHIL/