X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

📄 arXiv: 2607.28560v1 📥 PDF

作者: Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

分类: cs.RO

发布日期: 2026-07-30

备注: 20 pages, 4 figures

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出GQRM框架以提升导航扩散策略的泛化能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting)

关键词: 导航策略 强化学习 扩散模型 机器人导航 多样化环境 群体Q值归一化 自引导探索

📋 核心要点

  1. 现有的导航扩散策略在多样化机器人和复杂场景中的泛化能力不足,导致在特定情况下表现不佳。
  2. 本文提出了一种名为GQRM的后训练框架,通过自引导探索和群体Q值归一化机制来提高策略的泛化能力。
  3. 实验结果表明,细化后的策略X-NavDP在视觉导航任务中显著提升了成功率,展示了其在不同环境中的有效性。

📝 摘要(中文)

预训练的导航扩散策略依赖于大规模专家示范,这些数据通常由适用于单一机器人模型的全知规划器生成。这限制了策略在多样化机器人和复杂场景中的泛化能力。为了解决这一问题,本文提出了一种数据高效的扩散强化学习后训练框架GQRM。该框架引入了自引导探索策略和群体Q值归一化机制,通过分布式在线强化学习训练,最终得到的细化策略X-NavDP在视觉导航性能上达到了新的状态,成功率在仿真中从61.20%提升至84.28%,在现实世界的困难案例中从10%提升至65%。

🔬 方法详解

问题定义:本文旨在解决现有导航扩散策略在多样化机器人和复杂场景中的泛化能力不足的问题。现有方法依赖于单一机器人模型的专家示范,导致在面对不同环境和障碍时表现不佳。

核心思路:论文提出GQRM框架,通过自引导探索策略和群体Q值归一化机制,提升策略的泛化能力。自引导探索策略保持了预训练策略的先验,而群体Q值归一化则通过计算每个状态的轨迹值来实现高效的重加权评分匹配。

技术框架:GQRM框架包含两个主要模块:自引导探索策略和群体Q值归一化机制。自引导探索策略通过行为扰动来增强策略的探索能力,而群体Q值归一化机制则在每个状态上计算轨迹值,以实现高效的重加权。

关键创新:最重要的创新点在于引入了自引导探索与群体Q值归一化的结合,这种设计有效解决了扩散策略的政策梯度不稳定和探索效率低下的问题,与传统的强化学习方法相比,显著提高了策略的泛化能力。

关键设计:在参数设置上,采用了适应性调整的探索率和重加权机制,损失函数设计为结合了传统的Q值损失和新提出的重加权损失,网络结构则基于现有的深度学习框架进行了优化,以适应多样化的机器人模型。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,细化后的策略X-NavDP在仿真环境中的成功率从61.20%提升至84.28%,在现实世界的困难案例中成功率从10%提升至65%。这些结果表明,GQRM框架在提升导航策略的泛化能力方面具有显著效果。

🎯 应用场景

该研究的潜在应用领域包括自主机器人导航、智能家居系统和复杂环境下的任务执行。通过提升导航策略的泛化能力,X-NavDP可以在多种实际场景中有效应用,具有重要的实际价值和广泛的未来影响。

📄 摘要(原文)

Pretraining navigation diffusion policies rely on large-scale expert demonstrations. These data are typically generated by a fully-informed oracle planner suited to a single nominal robot. This limits the policy's generalization to diverse embodiments and challenging scenarios (e.g., escaping dead ends or detouring long obstacles) that demand diverse local reactive behaviors with only onboard local observations. Post-training the policy with reinforcement learning (RL) offers a principled remedy. However, previous RL for diffusion approaches lead to only marginal improvements. This is because the intractable likelihood of diffusion policies renders policy gradients unstable in addition to inefficient policy exploration. To address these challenges, we propose a data-efficient diffusion RL post-training framework - GQRM (Group Q-score Reweighted Matching). Our framework introduces two complementary designs: (i) a self-bootstrapped exploration strategy with behavior perturbation that preserves the pretrained policy prior, and (ii) a group Q-score normalization mechanism that computes per-trajectory values on each state for efficient reweighted score matching. By conducting distributed online RL training across heterogeneous embodiments, the resulting fine-tuned policy, X-NavDP, achieves state-of-the-art cross-embodiment visual navigation performance, improving the overall success rate from 61.20% to 84.28% in simulation and 10% to 65% in real-world hard cases. The code and model are publicly available at https://yty-sky.github.io/x-navdp-project-page.