Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

📄 arXiv: 2608.30398v1 📥 PDF

作者: Xiaoyang Chen, Jie Liu, Haijin Liang, Haibo Shi, Jin Ma, Ben He, Yingfei Sun, Dezhi Ye

分类: cs.CL, cs.IR

发布日期: 2026-08-31

备注: Accepted at EMNLP 2026 Findings


💡 一句话要点

提出链式思维模型以解决点对点重排序中的评分偏差问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 链式思维 点对点重排序 强化学习 细粒度监督 模型优化

📋 核心要点

  1. 现有的链式思维模型在点对点重排序任务中表现不佳,无法与直接评分模型相媲美。
  2. 论文通过强化学习、细粒度监督和架构解耦等方法,尝试修复模型在重排序中的偏差。
  3. 实验结果显示,尽管分类准确性有所提升,但相对排名差距依然存在,揭示了模型的固有限制。

📝 摘要(中文)

在点对点文档重排序中,链式思维模型通常表现不如直接评分模型。现有研究将这一现象归因于分类能力不足、评分极化或校准失效,但针对性训练是否能弥补这一差距尚不明确。我们的实证研究首先确认这一差距在参数规模高达320亿时依然稳定,排除了模型和数据容量的混淆因素。随后,我们利用强化学习、细粒度监督和架构解耦进行压力测试,以显式修复这些偏差。尽管这些干预措施提高了分类准确性和绝对评分,但相对排名差距依然存在。这些发现表明,在点对点评分范式下,通过离散文本传递连续相关语义限制了排名信号的分辨率,揭示了在当前标准方法下稳定且难以克服的瓶颈,而非易于解决的训练偏差。

🔬 方法详解

问题定义:本论文旨在解决链式思维模型在点对点重排序中的表现不足,现有方法面临评分极化和分类能力不足的问题。

核心思路:通过引入强化学习和细粒度监督等技术,论文试图修复模型在重排序中的偏差,改善分类准确性和评分表现。

技术框架:整体架构包括数据预处理、模型训练和评估三个主要阶段,采用强化学习优化评分过程,并结合细粒度监督提升模型的学习效果。

关键创新:论文的创新点在于通过架构解耦和多种干预措施,明确识别并修复了模型在重排序中的固有偏差,与现有方法相比,提供了更深入的分析和解决方案。

关键设计:在模型设计中,采用了新的损失函数以平衡分类准确性和评分绝对值,同时在网络结构上进行了优化,以适应细粒度监督的需求。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,尽管通过强化学习和细粒度监督等方法提高了分类准确性,但相对排名差距依然存在,显示出在320亿参数规模下模型的固有限制。这一发现为未来的研究提供了新的方向。

🎯 应用场景

该研究的潜在应用领域包括信息检索、推荐系统和自然语言处理等。通过改进点对点重排序的模型性能,可以提升用户体验和信息获取效率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

In pointwise document reranking, Chain-of-Thought models typically underperform direct scoring models. While existing diagnostics attribute this to inferior classification, score polarization, or calibration breakdown, whether targeted training can bridge this gap remains unclear. Our empirical study first confirms that this gap is stable across scales up to 32B parameters, ruling out model and data capacity confounders. We then apply stress tests utilizing reinforcement learning, fine-grained supervision, and architectural decoupling to explicitly repair these deviations. Although these interventions improve classification accuracy and absolute scores, the relative ranking gap persists. These findings suggest that, within the pointwise scoring paradigm, routing continuous relevance semantics through discrete text constrains ranking signal resolution, revealing a bottleneck that is stable and difficult to overcome under current standard methods, rather than an easily resolvable training bias.