Learning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval
作者: Shaowei Wei, Chong Huang, Songtao Fang, Jin Zhang, Zhuojun Wang, Chengfu Huo
分类: cs.IR, cs.AI
发布日期: 2026-08-31
💡 一句话要点
提出PAO方法以解决大规模电商检索中的优化问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 检索优化 电商检索 语义流形 选择性更新 双编码器 奖励模型
📋 核心要点
- 现有的双编码器检索器与下游重排序器之间的目标不匹配,限制了检索质量的提升。
- 提出PAO方法,通过选择性强化学习优化,仅对正优势样本进行梯度更新,保持全局拓扑稳定性。
- 实验结果显示,PAO在多个数据集上显著优于传统的强化学习和蒸馏方法,提升了检索性能。
📝 摘要(中文)
在大规模电商检索中,双编码器检索器优化对比相似度,而下游重排序器捕捉更细粒度的相关性偏好,这种目标不匹配限制了端到端检索质量。强化学习提供了一种利用奖励模型反馈进行检索器适应的方法,但我们观察到标准的策略梯度更新可能会破坏嵌入几何,尤其是在文档索引因工业限制必须保持不变的情况下。为此,我们提出了PAO(Positive-Advantage-Only),一种选择性强化学习优化方法。我们的分析表明,在冻结的高维空间中对负样本的不加区分惩罚会破坏预训练的语义流形。PAO选择性地仅对具有正优势的检索项应用梯度更新,有效地将查询嵌入拉向高奖励区域,同时保持全局拓扑稳定性。实验结果表明,PAO在大型工业数据集和公共基准上显著优于标准强化学习和蒸馏基线。
🔬 方法详解
问题定义:本论文旨在解决大规模电商检索中双编码器检索器与下游重排序器之间的目标不匹配问题。现有方法在强化学习中使用标准策略梯度更新,可能导致嵌入几何的退化,尤其是在文档索引必须保持不变的情况下。
核心思路:论文提出的PAO方法通过选择性地对具有正优势的检索项进行梯度更新,避免了对负样本的不加区分惩罚,从而保护了预训练的语义流形。这种设计旨在有效地将查询嵌入拉向高奖励区域,同时保持全局的拓扑稳定性。
技术框架:PAO方法的整体架构包括三个主要模块:首先是检索器,通过对比相似度进行初步检索;其次是奖励模型,用于评估检索结果的相关性;最后是选择性更新机制,仅对正优势样本进行梯度更新。
关键创新:PAO的核心创新在于其选择性强化学习优化策略,区别于传统方法的全局更新方式,能够有效避免对负样本的惩罚对嵌入几何的破坏。
关键设计:在PAO中,关键的参数设置包括选择性更新的阈值,以及损失函数的设计,确保仅对正优势样本进行优化。此外,网络结构保持与预训练模型一致,以便于在高维空间中进行有效的嵌入调整。
🖼️ 关键图片
📊 实验亮点
实验结果表明,PAO方法在大型工业数据集和公共基准上显著优于标准强化学习和蒸馏基线,提升幅度达到XX%(具体数据需根据实验结果填入),验证了其在实际应用中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括大规模电商平台的商品检索、信息检索系统以及推荐系统等。通过提升检索质量,PAO方法能够显著改善用户体验,推动电商行业的智能化发展,未来可能在其他领域的检索任务中也具有广泛的应用价值。
📄 摘要(原文)
In large-scale e-commerce retrieval, dual-encoder retrievers are op- timized for contrastive similarity, whereas downstream rerankers capture finer-grained relevance preferences; this objective mis- match limits end-to-end retrieval quality. Reinforcement Learning offers a way to use reward-model feedback for retriever adaptation, but we observe that standard policy-gradient updates can degrade embedding geometry, especially when the document index must remain frozen due to industrial constraints. To address this, we propose PAO (Positive-Advantage-Only), a selective RL optimization method. Our analysis reveals that in- discriminate penalization of negative samples (pushing away) in a frozen high-dimensional space disrupts pre-trained semantic man- ifolds. PAO selectively applies gradient updates only to retrieved items with positive advantages, effectively pulling query embed- dings toward high-reward regions while preserving global topo- logical stability. Experiments on both a massive industrial dataset and public benchmarks demonstrate that PAO significantly outper- forms standard RL and distillation baselines.