CoDrift: Compositional Drifting for Offline Reinforcement Learning

📄 arXiv: 2608.23939v1 📥 PDF

作者: Xiewei Ni, Ruofeng Mei, Xiangyu Xu

分类: cs.LG, cs.RO

发布日期: 2026-08-25


💡 一句话要点

提出CoDrift以解决离线强化学习中的多目标问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 多目标学习 生成策略 动作空间 机器人控制 自动驾驶 游戏AI

📋 核心要点

  1. 现有离线强化学习方法在多目标兼容性和高价值动作选择上存在挑战,难以有效整合不同目标。
  2. CoDrift通过将多个目标场组合成一个统一的策略场,提供了一种新的生成策略学习框架,能够更好地处理异构目标。
  3. 在OGBench和D4RL的73个任务中,CoDrift在离线和离线到在线的设置中均表现优异,取得了最佳平均排名。

📝 摘要(中文)

离线强化学习本质上是多目标的:策略必须与固定数据集的行为支持兼容,同时优先选择高价值动作。本文将这些目标重新表述为一种动作空间运动场,允许通过场的组合直接整合异构学习目标。我们提出了CoDrift,一个用于一步生成策略学习的组合框架。CoDrift将三个目标级别的场组合成一个统一的策略场,条件场保留状态依赖的行为结构,边际场在状态间汇聚动作以提供更稳定的生成信号,而价值场则将生成的动作引导至高价值区域。我们在OGBench和D4RL的73个任务上评估了CoDrift,结果显示其在离线和离线到在线设置中均优于现有方法,取得了最佳平均排名。

🔬 方法详解

问题定义:离线强化学习需要在固定数据集的行为支持下选择高价值动作,现有方法难以有效整合多目标,导致性能受限。

核心思路:CoDrift通过将不同的目标场组合成一个统一的策略场,允许在生成策略时同时考虑多个目标,从而提高生成动作的质量和稳定性。

技术框架:CoDrift的整体架构包括三个主要模块:条件场、边际场和价值场。条件场保留状态依赖的行为结构,边际场在不同状态间汇聚动作,价值场则引导生成动作向高价值区域移动。

关键创新:CoDrift的创新在于其组合框架,能够将异构目标直接整合为一个统一的生成策略,与现有方法相比,提供了更灵活和高效的学习机制。

关键设计:在设计中,CoDrift使用了特定的损失函数来平衡不同目标的影响,并采用了随机生成器来在部署时通过单次前向传递生成动作。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在OGBench和D4RL的73个任务中,CoDrift在离线和离线到在线设置中均表现出色,比较现有最先进的方法,取得了最佳平均排名,显示出其在多目标学习中的优势。

🎯 应用场景

CoDrift的研究成果在机器人控制、自动驾驶、游戏AI等领域具有广泛的应用潜力。通过提高离线强化学习的效率和效果,CoDrift可以帮助开发更智能的自主系统,推动相关技术的进步和应用落地。

📄 摘要(原文)

Offline reinforcement learning is intrinsically multi-objective: a policy must remain compatible with the behavioral support of a fixed dataset while preferentially selecting high-value actions. We recast these objectives in a common form by viewing each as an action-space motion field that specifies how generated actions should move. This perspective enables heterogeneous learning objectives to be combined directly through field composition. Inspired by drifting models, we propose CoDrift, a compositional framework for one-step generative policy learning. CoDrift combines three objective-level fields into a unified policy field. The conditional field preserves state-dependent behavioral structure, while the marginal field pools actions across states to provide a more stable generative signal in the single-positive-sample regime of continuous-control offline RL. The value field moves generated actions toward higher-value regions. The composed field is absorbed into a stochastic generator that produces an action with a single forward pass at deployment. We evaluate CoDrift on 73 tasks from OGBench and D4RL in both offline and offline-to-online settings. CoDrift compares favorably with state-of-the-art methods and achieves the best average rank in both settings.