Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving
作者: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu
分类: cs.RO
发布日期: 2026-09-03
💡 一句话要点
提出StyleDrive以解决长时间一致性和多样化驾驶风格问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 世界模型 强化学习 自动驾驶 多样化策略 时间一致性 状态解耦 交通状态建模 仿真到现实转移
📋 核心要点
- 现有的世界模型在长时间想象回合中存在时间不一致性,且对自我与环境的交互建模不足,限制了其适应多样化驾驶风格的能力。
- 论文提出StyleDrive,通过时间一致性正则化、状态解耦模块和多样化策略优化,解决了长时间一致性和交互状态建模的问题。
- 在Bench2Drive基准测试中,StyleDrive的驾驶得分达到88.44,成功率为66.82,均显著优于之前的最佳方法,且在实际应用中表现出良好的转移能力。
📝 摘要(中文)
端到端的自动驾驶越来越多地采用基于世界模型的强化学习框架,通过想象的回合提高学习效率。然而,现有的世界模型存在三个主要限制:长时间想象回合中的时间不一致性、对自我与环境交互建模不足,以及对多样化驾驶风格适应性有限。为了解决这些挑战,我们提出了StyleDrive,一个基于世界模型的学习框架,联合强制长时间一致性,明确解耦交互交通状态,并在统一学习范式中支持多样化策略优化。我们在Bench2Drive闭环驾驶基准上评估StyleDrive,取得了88.44的驾驶得分(比之前最佳世界模型方法提高17.08)和66.82的成功率(提高16.58)。此外,我们在真实的自动引导车平台上部署StyleDrive,展示了在动态驾驶场景中的良好仿真到现实转移能力。
🔬 方法详解
问题定义:论文要解决的问题是现有基于世界模型的自动驾驶方法在长时间想象回合中的时间不一致性、交互状态建模不足以及对多样化驾驶风格适应性差等痛点。
核心思路:论文的核心思路是通过引入时间一致性正则化、状态解耦模块和多样化策略优化,来提升模型在复杂交通场景中的决策能力和适应性。
技术框架:整体架构包括三个主要模块:时间一致性正则化模块、状态解耦模块和多样化策略优化模块。时间一致性正则化通过门控交叉注意力机制整合历史潜在状态,状态解耦模块则分离自我相关与非自我相关的交互状态。
关键创新:最重要的技术创新点在于引入了时间一致性正则化和状态解耦模块,使得模型在长时间想象回合中保持一致性,并提高了决策的可解释性和效率。
关键设计:在设计中,采用了门控交叉注意力机制来实现时间一致性,状态解耦模块则通过明确的状态分离策略来提升模型的决策能力,同时在多样化策略优化中使用了基于轨迹的相对优势替代逐步奖励优化。
🖼️ 关键图片
📊 实验亮点
在Bench2Drive基准测试中,StyleDrive的驾驶得分达到88.44,较之前最佳世界模型方法提升17.08,成功率为66.82,提升幅度为16.58。此外,StyleDrive在真实自动引导车平台上的应用展示了良好的仿真到现实转移能力,验证了其实际应用潜力。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、智能交通系统和机器人导航等。通过提升模型的长时间一致性和适应多样化驾驶风格的能力,StyleDrive能够在复杂的交通环境中实现更安全、更高效的自动驾驶,具有重要的实际价值和未来影响。
📄 摘要(原文)
End-to-end autonomous driving has increasingly adopted world model-based reinforcement learning frameworks to improve learning efficiency through \textit{imagined rollouts}. However, existing world models suffer from three key limitations: temporal inconsistency in long-horizon imagined rollouts, inadequate modeling of ego-environment interactions, and limited adaptability to diverse driving styles. To address these challenges, we propose \textit{StyleDrive}, a world-model-based learning framework that jointly enforces long-horizon consistency, explicitly disentangles interactive traffic states, and supports multi-style policy optimization within a unified learning paradigm. First, we introduce a temporal consistency regularization that integrates historical latent states through gated cross-attention, stabilizing long-horizon imagined rollouts and mitigating error accumulation. Second, we design an explicit state disentanglement module that separates ego-relevant from ego-irrelevant interactive states, enabling more interpretable and efficient decision-making in complex traffic scenarios. Third, we enable multi-style driving behaviors through Group Relative Policy Optimization, which replaces per-step reward optimization with trajectory-wise relative advantages, reducing reward variance and supporting diverse driving styles without retraining. We evaluate StyleDrive on the Bench2Drive closed-loop driving benchmark, achieving a driving score of 88.44 (+17.08 over the previous best world model-based method) and a success rate of 66.82 (+16.58). Furthermore, we deploy StyleDrive on a real automated guided vehicle platform and demonstrate promising sim-to-real transfer capability in dynamic driving scenarios.