Multi-channel Uplift Policy Learning
作者: Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng
分类: cs.LG
发布日期: 2026-07-30
💡 一句话要点
提出ReAlloc框架以解决多渠道营销预算分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多渠道营销 提升决策 因果框架 正交教师 解释引导学生 商业效用 资源优化
📋 核心要点
- 现有的预测-优化方法在多渠道营销预算分配中面临观察性混淆和外推问题,导致效果不佳。
- 论文提出ReAlloc框架,通过正交教师和解释引导学生的协作,提取和利用无偏梯度进行决策。
- 实验结果显示,ReAlloc在淘宝平台的应用中,支付订单和收入均实现了显著提升。
📝 摘要(中文)
电子商务平台必须在多个渠道之间分配固定的营销预算,以最大化商业效用。然而,标准的预测-优化(PTO)范式在这一组合空间中由于观察性混淆和严重的外推问题而失效。我们将这一挑战表述为一个简单约束的提升决策问题,并提出了ReAlloc,一个快速-慢速的因果框架。具体而言,敏捷的正交教师从短期日志中提取无偏的局部梯度,而解释引导的学生将其提炼为长期视野下的结构化边际场。这一设计使得支持感知的保守决策能够捕捉跨渠道替代关系。大量模拟和在淘宝平台的大规模在线A/B测试表明,ReAlloc在支付订单和收入方面实现了双重提升。
🔬 方法详解
问题定义:本论文旨在解决电子商务平台在多个渠道中分配固定营销预算时的决策问题。现有的预测-优化方法在处理观察性混淆和外推时效果不佳,导致无法有效利用数据进行决策。
核心思路:论文提出的ReAlloc框架结合了快速的正交教师和慢速的解释引导学生,通过提取无偏的局部梯度并将其转化为结构化的边际场,从而实现更为精准的决策。这样的设计旨在克服传统方法的局限性,提升决策的有效性。
技术框架:ReAlloc框架包括两个主要模块:正交教师和解释引导学生。正交教师负责从短期日志中提取局部梯度,而解释引导学生则将这些信息整合为长期的决策支持。整个流程通过交替训练和优化实现。
关键创新:ReAlloc的核心创新在于其因果框架的设计,能够有效捕捉跨渠道的替代关系,并在决策中考虑支持感知的保守性。这与传统的PTO方法有本质区别,后者往往忽视了这些复杂的交互关系。
关键设计:在模型设计中,使用了特定的损失函数来优化梯度提取的准确性,同时在网络结构上采用了多层次的架构,以确保信息的有效传递和利用。
🖼️ 关键图片
📊 实验亮点
在淘宝平台的大规模在线A/B测试中,ReAlloc框架实现了支付订单和收入的双重提升,具体提升幅度未知。与传统方法相比,ReAlloc在决策支持的有效性上表现出显著优势,证明了其在实际应用中的价值。
🎯 应用场景
该研究的潜在应用领域主要集中在电子商务和数字营销中,特别是在需要优化多渠道营销预算分配的场景。通过提升决策的有效性,ReAlloc框架能够帮助企业实现更高的商业效用,进而推动销售增长和收入提升。未来,该方法还可能扩展到其他需要复杂决策支持的领域,如广告投放和资源配置等。
📄 摘要(原文)
E-commerce platforms must allocate fixed marketing budgets across multiple channels to maximize business utility. However, standard predict-then-optimize (PTO) paradigms fail in this compositional space due to observational confounding and severe extrapolation. We formulate this challenge as a simplex-constrained uplift decision problem and propose ReAlloc, a fast-slow causal framework. Specifically, an agile Orthogonal Teacher extracts unbiased local gradients from short-term logs, while an Explanation-Guided Student distills them into a structured marginal field over long-term horizons. This design enables support-aware, conservative decisions that capture cross-channel substitutions. Extensive simulations and large-scale online A/B tests on Taobao platform demonstrate that ReAlloc achieves simultaneous lifts in both pay order and income.