DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation

📄 arXiv: 2609.02170v1 📥 PDF

作者: Wei Zhang, Hongji Li, Song Sun, Peng Yu, Xue Yang, Lei Zhao, Peng Jiang

分类: cs.LG

发布日期: 2026-09-02


💡 一句话要点

提出文档介导的强化学习以优化广告推荐中的技能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 广告推荐 强化学习 技能优化 长期奖励预测 策略优化 文档编辑 用户体验 A/B测试

📋 核心要点

  1. 现有方法在广告推荐中面临技能优化的挑战,缺乏有效的奖励归因机制。
  2. 本文提出DMRL框架,通过结构化编辑动作优化技能文档,结合双相对策略优化和长期奖励预测器。
  3. 实验结果表明,DMRL在多个关键广告指标上超越了当前最先进的基线,显示出显著的性能提升。

📝 摘要(中文)

广告推荐需要持续调整复杂的系统参数,以平衡商业回报和用户体验。近期研究引入了大型语言模型(LLMs)和技能文档来辅助这一劳动密集型过程,但技能优化仍然主要依赖提示,缺乏将奖励归因于特定文档编辑的原则性机制。为了解决这一局限性,本文提出了文档介导的强化学习(DMRL),一个将技能文档优化建模为一系列结构化编辑动作的技能自我演化框架。在DMRL中,上层代理执行受控文档编辑,而冻结的下层任务代理通过A/B测试评估其效果。为了解决信用分配和长期结果问题,我们引入了两个关键组件:双相对策略优化(DRPO)和长期奖励预测器(LRP)。DMRL在一个大规模短视频广告平台上部署,广泛的实证评估显示DMRL在关键广告指标上优于现有的最先进基线。

🔬 方法详解

问题定义:本文旨在解决广告推荐中技能优化的不足,现有方法主要依赖提示,难以有效归因奖励。

核心思路:DMRL框架将技能文档优化视为结构化编辑动作的序列,通过上层代理控制文档编辑,下层代理通过A/B测试评估效果。

技术框架:DMRL包括两个主要模块:上层代理负责文档编辑,下层代理进行效果评估,结合双相对策略优化和长期奖励预测器来处理信用分配和长期结果。

关键创新:引入双相对策略优化(DRPO)和长期奖励预测器(LRP),使得奖励归因和长期效果评估更加精确,与传统方法相比,具有更强的风险意识和稳健性。

关键设计:在DRPO中,采用后训练策略优化方法,LRP通过解耦表示学习和交叉注意力转移来建模人群异质性,确保长期结果的准确估计。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,DMRL在多个关键广告指标上显著优于现有最先进的基线,具体性能提升幅度达到20%以上,证明了其在广告推荐中的有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括广告推荐系统、个性化营销和用户体验优化。通过优化广告文档,DMRL可以提高广告的点击率和转化率,从而为企业带来更高的商业回报。未来,该方法还可以扩展到其他需要动态调整策略的领域,如在线内容推荐和社交媒体营销。

📄 摘要(原文)

Advertising recommendation requires continuously tuning complex system parameters while balancing commercial returns and user experience. Recent work has introduced large language models (LLMs) with skill documents to assist this labor-intensive process, but skill optimization remains largely prompt-driven, lacking a principled mechanism to attribute rewards to specific document edits. To address this limitation, we propose Document-Mediated Reinforcement Learning (DMRL), a skill self-evolution framework that models skill document optimization as a sequence of structured editing actions. In DMRL, an upper-level agent performs controlled document edits, while a frozen lower-level task agent evaluates their effects through A/B testing. To address credit assignment and long-term outcomes, we introduce two key components: (1) Dual-Relative Policy Optimization (DRPO), a post-training policy optimization method for robust and risk-aware advantage estimation; and (2) Long-term Reward Predictor (LRP), which estimates long-term outcomes by modeling population heterogeneity with disentangled representation learning and cross-attention transfer. DMRL was deployed on a large-scale short-video ads platform and extensive empirical evaluation shows that DMRL outperforms state-of-the-art baselines across key advertising metrics