Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving
作者: Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong
分类: cs.LG, cs.RO
发布日期: 2026-08-11
备注: 13 pages, 6 figures
💡 一句话要点
提出Dreamer-SAC框架以解决自主驾驶中的样本效率问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 样本效率 自主驾驶 强化学习 世界模型 策略优化 多目标监督 n步目标估计
📋 核心要点
- 现有的自主驾驶强化学习方法在样本效率与模型偏差之间存在显著的权衡,限制了其性能。
- 本文提出的Dreamer-SAC框架通过结合递归状态空间模型与离线软演员-评论家算法,直接在潜在空间中进行训练。
- 实验结果显示,Dreamer-SAC在多个自主驾驶场景中超越了包括DreamerV3、SAC和PPO在内的基线方法,且减少了真实环境交互的需求。
📝 摘要(中文)
样本效率强化学习在自主驾驶中常受到数据效率与模型偏差之间的权衡限制。尽管世界模型减少了对昂贵环境交互的依赖,但在学习动态上进行策略优化仍对预测误差敏感。本文提出了Dreamer-SAC框架,该框架将递归状态空间世界模型与直接在潜在空间中训练的离线软演员-评论家算法相结合。该框架结合了真实交互和短时间生成轨迹,采用n步目标估计和多目标监督。在自主驾驶场景中进行评估时,该框架在驾驶效率和安全性等目标上始终优于代表性的强化学习基线,包括DreamerV3、SAC和PPO,同时在减少真实环境交互的情况下实现了更好的性能。实验表明,展开时间与策略性能之间存在倒U型关系,短时间潜在展开在额外训练信号与累积模型偏差之间实现了最佳权衡。此外,n步目标估计在利用预测经验进行价值学习方面比一步时间差目标更有效。
🔬 方法详解
问题定义:本文旨在解决自主驾驶中的样本效率问题,现有方法在数据效率与模型偏差之间存在权衡,导致性能受限。
核心思路:Dreamer-SAC框架通过结合递归状态空间世界模型与离线软演员-评论家算法,直接在潜在空间中进行训练,以提高样本效率和策略优化的稳定性。
技术框架:该框架包括真实交互与短时间生成轨迹的结合,采用n步目标估计和多目标监督,整体流程涵盖了模型学习与策略优化两个主要阶段。
关键创新:最重要的创新在于将潜在空间中的策略优化与n步目标估计相结合,显著提高了模型的样本效率与性能稳定性。
关键设计:框架中采用了递归神经网络结构来建模状态空间,损失函数设计上注重多目标监督,以平衡驾驶效率与安全性,同时优化了n步目标估计的实现。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Dreamer-SAC在自主驾驶任务中显著优于DreamerV3、SAC和PPO等基线方法,尤其在样本使用效率上表现突出,减少了真实环境交互的需求,提升幅度明显。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶汽车、智能交通系统以及机器人导航等。通过提高样本效率,Dreamer-SAC框架能够在减少真实环境交互的情况下,提升自主驾驶系统的安全性与效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Sample-efficient reinforcement learning for autonomous driving is often limited by the trade-off between data efficiency and model bias. While world models reduce the reliance on costly environment interactions, policy optimization over learned dynamics remains sensitive to prediction errors. This paper proposes the Dreamer-SAC framework, which integrates a recurrent state-space world model with an off-policy soft actor-critic algorithm trained directly in latent space. The framework uses a combination of real interactions and short-horizon generated trajectories with n-step target estimation and multi-objective supervision. Evaluated in autonomous driving scenarios with objectives encompassing driving efficiency and safety, the proposed framework consistently outperforms representative reinforcement learning baselines, including DreamerV3, SAC, and PPO, while achieving improved performance with substantially fewer real environment interactions. Experiments reveal an inverted-U relationship between rollout horizon and policy performance, where short-horizon latent rollouts achieve the best trade-off between additional training signals and accumulated model bias. Furthermore, n-step target estimation demonstrates more effectiveness over one-step temporal-difference targets in exploiting predicted experience for value learning.