Localize-Then-Decide Guarantees for LLM Judgments
作者: Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin
分类: cs.CL
发布日期: 2026-08-26
备注: Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: https://github.com/llm2409/Localize-Then-Decide
💡 一句话要点
提出Localize-Then-Decide框架以解决LLM判断一致性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 置信度阈值 符合预测 人类偏好 评估一致性 自动化内容审核 智能客服 机器学习
📋 核心要点
- 现有的置信度阈值方法在候选响应数量增加时,可能导致置信度估计失真,从而影响与人类判断的一致性。
- 本文提出的Localize-Then-Decide框架通过先定位人类偏好的响应,再基于置信度选择最终响应,有效解决了这一问题。
- 实验结果显示,该框架在多个数据集上相比于单阶段基线,保证成功率和覆盖率均显著提高。
📝 摘要(中文)
大型语言模型(LLMs)越来越多地被用作评估工具,以评估输出质量和偏好一致性,但提供与人类判断一致的可靠保证仍然具有挑战性。近期研究引入了置信度阈值方法,为成对比较提供了这样的保证,依赖于更高的置信度意味着与人类的低不一致风险的假设。然而,当候选响应数量增加时,这一假设可能失效,因为在多个备选项之间分配概率质量会扭曲置信度估计。为了解决这一问题,本文提出了Localize-Then-Decide框架。该框架首先通过符合预测定位出一个包含人类偏好响应的小短名单,然后通过校准的基于置信度的规则从该短名单中选择单一响应或放弃。该设计恢复了置信度与不一致风险之间的单调关系,并实现了高概率的一致性保证。实验表明,该框架在多个候选大小和数据集上始终实现了更高的保证成功率和显著更高的覆盖率。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在评估输出时与人类判断一致性不足的问题。现有方法在候选响应数量增加时,置信度估计可能失真,导致不一致性风险上升。
核心思路:论文提出的Localize-Then-Decide框架通过两个阶段来提高判断一致性。首先,通过符合预测定位出一个小短名单,确保其中包含人类偏好的响应。然后,使用校准的置信度规则从短名单中选择最终响应或放弃。
技术框架:该框架分为两个主要模块:第一阶段是符合预测,用于生成高概率包含人类偏好响应的短名单;第二阶段是基于置信度的选择规则,决定最终输出或放弃。
关键创新:最重要的创新在于恢复了置信度与不一致风险之间的单调关系,使得高置信度能够更可靠地反映与人类判断的一致性。与现有方法相比,该设计显著提高了保证成功率。
关键设计:在短名单生成中,采用符合预测算法以确保高概率的响应选择;在选择规则中,使用校准的置信度阈值,以便在置信度不足时能够选择放弃而非错误判断。
🖼️ 关键图片
📊 实验亮点
实验结果显示,Localize-Then-Decide框架在多个数据集上相比于单阶段基线,保证成功率提高了显著的百分比,覆盖率也有明显提升,证明了其在处理多候选响应时的有效性和可靠性。
🎯 应用场景
该研究的潜在应用领域包括自动化内容审核、智能客服系统以及任何需要高质量人机交互的场景。通过提高大型语言模型的判断一致性,该框架能够增强用户信任,提升系统的实际应用价值。未来,该方法可能在更多领域得到推广,推动智能评估技术的发展。
📄 摘要(原文)
Large language models (LLMs) are increasingly used as evaluators to assess output quality and preference alignment, yet providing reliable guarantees of agreement with human judgments remains challenging. Recent work introduces confidence-thresholding methods that provide such guarantees for pairwise comparisons, relying on the assumption that higher estimated confidence implies lower disagreement risk with humans. However, this assumption can break down when the number of candidate responses increases, since distributing probability mass across many alternatives can distort confidence estimates. To address this issue, we propose a Localize-Then-Decide framework. First, conformal prediction localizes a small shortlist that contains the human-preferred response with high probability. Then, a calibrated confidence-based rule selectively chooses a single response from this shortlist or abstains. This design restores the monotonic relationship between confidence and disagreement risk and enables high-probability agreement guarantees. Experiments with multiple candidate sizes across several datasets and judge LLMs demonstrate that our framework consistently achieves higher guarantee success rates and substantially higher coverage than single-stage baselines.