Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning
作者: Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue
分类: cs.AI
发布日期: 2026-08-28
💡 一句话要点
提出基于离线模型强化学习的激励广告分配方法
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 激励广告 强化学习 离线学习 马尔可夫决策过程 用户反馈 收益优化 反事实评估
📋 核心要点
- 现有方法未能有效解决激励广告中的决策算法问题,导致激励分配不够优化。
- 本文提出了一种基于MDP的离线模型强化学习框架,能够进行成本可控的序列激励分配。
- 实验结果显示,MB-IQL在每用户净利润上比TD3+BC提高了7.96%,而回归到普通IQL则降低了6.56%。
📝 摘要(中文)
在激励广告中,平台在观察到下游广告收入之前承诺用户奖金,以鼓励他们点击并完成广告。必须在预先承诺的激励与后续实现的收入之间取得平衡:激励不足会失去变现机会,而激励过多则会降低净利润。由于现有激励也会影响用户期望和未来参与,因此激励分配是一个具有延迟收入、成本敏感性和延续效应的序列决策问题。现有研究未探讨此设置下的决策算法。本文将问题形式化为马尔可夫决策过程(MDP),并开发了一个离线模型基础的强化学习框架,用于可控成本的序列激励分配。该框架学习用户反馈和广告收入的世界模型,然后进行保守的策略优化。独立的反事实评分器评估每个学习策略在保留日志上的表现,实现了在不进行昂贵在线曝光的情况下进行预发布选择。实验结果表明,该评分器提供了稳定的离线信号。
🔬 方法详解
问题定义:本文旨在解决激励广告中激励分配的决策问题。现有方法如自动竞价和目标推广未能有效整合广告变现流程,导致激励不足或过度的问题。
核心思路:论文提出将激励分配问题形式化为马尔可夫决策过程(MDP),并利用离线模型强化学习(MBRL)进行优化,以实现对用户反馈和广告收入的有效学习和预测。
技术框架:整体架构包括三个主要模块:首先,构建用户反馈和广告收入的世界模型;其次,进行保守的策略优化以提升激励分配效果;最后,使用独立的反事实评分器评估策略的表现,确保在不进行在线测试的情况下进行策略选择。
关键创新:最重要的技术创新在于引入了反事实评分器,使得在离线环境中能够有效评估和选择策略,避免了在线测试带来的成本和风险。
关键设计:在模型设计中,采用了保守策略优化方法,确保在激励分配中兼顾成本控制与收益最大化,同时设置了适当的损失函数以平衡激励与收入之间的关系。具体的网络结构和参数设置在实验中经过多次调优,以达到最佳效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,MB-IQL在每用户净利润上比TD3+BC提高了7.96%,而回归到普通IQL则降低了6.56%,且所有结果均具有统计学显著性(p<0.0001),验证了所提方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括在线广告平台、电子商务和社交媒体等,能够帮助这些平台在激励用户参与的同时,优化广告收入和用户体验。未来,该方法可能推动激励广告领域的进一步发展,提高广告投放的效率和效果。
📄 摘要(原文)
Complete your ad view and grab a 5-cent bonus! In incentivized advertising, a platform promises users a bonus before observing downstream ad revenue, encouraging them to click and complete ads. It must balance the incentive promised in advance against the revenue realized afterward: insufficient incentives forfeit monetization opportunities, whereas excessive incentives reduce net profit. Because current incentives may also shape user expectations and future engagement, incentive allocation is a sequential decision problem with delayed revenue, cost sensitivity, and carryover effects. Existing work has not studied decision-making algorithms for this setting. Auto-bidding assumes available ad opportunities, while targeted promotion optimizes incentives outside the ad monetization pipeline. We formulate the problem as an MDP and develop an offline model-based RL framework for cost-controllable sequential incentive allocation. It learns a world model of user feedback and ad revenue, then performs conservative policy optimization. An independent counterfactual scorer evaluates each learned policy on held-out logs, enabling pre-launch selection without costly online exposure. Experiments on large-scale industrial data and online A/B tests show that the scorer provides a stable offline signal. The deployment path from causal inference to offline RL and then Offline-MBRL further validates the framework: MB-IQL improves per-user net profit by 7.96\% over TD3+BC, whereas reverting to plain IQL reduces it by 6.56\% (both (p<0.0001)).