POOL: Propagated Uncertainty Over Lookalikes
作者: Rounak Sharma, Ananya B. Sai, Soumyabrata Pal
分类: cs.AI
发布日期: 2026-08-24
💡 一句话要点
提出POOL框架以解决黑箱语言模型的置信度估计问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 置信度估计 黑箱模型 聚类方法 自然语言处理 模型评估 成本效率 软性传播 谱答案多样性
📋 核心要点
- 现有的置信度估计方法在成本与质量之间存在权衡,导致过于自信或信息不足的问题。
- 论文提出的POOL框架通过聚类和软性传播置信度评分,优化了置信度估计的效率与准确性。
- 实验结果表明,POOL-Hy@5在多个领域中显著提高了AUROC,同时减少了生成样本的数量。
📝 摘要(中文)
黑箱大型语言模型需要置信度评分,以区分可能正确和可能错误的输出,从而帮助系统优先进行人工审核、将不确定的案例路由到更强的模型,或在开发数据上选择放弃阈值。然而,现有的置信度估计器面临成本与质量的权衡:口头置信度便宜但往往过于自信,而基于采样的不确定性更具信息性,但随着每个查询的样本数量线性增长。我们提出了POOL(Propagated Uncertainty Over Lookalikes),一个高效的框架,灵感来自于组测试。POOL对查询进行聚类,评估代表性中值上的基础估计器,软性传播置信度评分到附近查询,并选择性地评估高分歧案例。我们用Hy@5实例化该框架,结合了口头置信度和从负冯·诺依曼熵计算的谱答案多样性。在三个数据集的六个领域和五个黑箱LLM上,Hy@5在使用一半样本的情况下,达到了比口头置信度和Vn@10采样更高的平均AUROC。
🔬 方法详解
问题定义:论文要解决的问题是如何在黑箱大型语言模型中有效估计输出的置信度,现有方法往往在成本和质量之间存在权衡,导致置信度过于自信或信息不足。
核心思路:POOL框架的核心思路是通过聚类相似查询,利用代表性样本来评估置信度,并通过软性传播将置信度信息传递给相邻查询,从而降低成本并提高准确性。
技术框架:POOL的整体架构包括查询聚类、基础估计器评估、置信度传播和高分歧案例选择四个主要模块。首先对查询进行聚类,然后在中值上评估基础估计器,接着将置信度评分传播到相似查询,最后选择性地评估高分歧的案例以提高置信度估计的准确性。
关键创新:最重要的技术创新点在于通过聚类和软性传播的方式,显著降低了置信度估计的成本,同时保持了较高的准确性,这与现有方法的线性采样方式形成了鲜明对比。
关键设计:在POOL中,使用了Hy@5作为基础估计器,该估计器结合了口头置信度和基于负冯·诺依曼熵的谱答案多样性,确保了在较少样本的情况下仍能保持较高的AUROC。
🖼️ 关键图片
📊 实验亮点
实验结果显示,POOL-Hy@5在六个领域的多个数据集上,平均AUROC显著高于口头置信度和Vn@10采样,同时使用的样本数量减少了50%。在语义冗余较高的工作负载中,生成节省率高达73-76%,显示出该方法在实际应用中的巨大潜力。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的模型评估、对话系统的置信度管理以及自动化审核系统。通过提高置信度估计的效率和准确性,POOL框架能够在实际应用中显著降低人力成本,并提高系统的可靠性和用户体验。
📄 摘要(原文)
Black-box large language models need confidence scores that can separate likely-correct from likely-incorrect outputs, enabling systems to prioritize human review, route uncertain cases to stronger models, or choose abstention thresholds on development data. Yet existing confidence estimators face a cost-quality trade-off: verbal confidence is cheap but is often overconfident, while sampling-based uncertainty is more informative but scales linearly with the number of samples per query. We propose \textsc{POOL} (\emph{Propagated Uncertainty Over Lookalikes}),a cost-efficient framework that addresses this trade-off taking inspiration from group-testing.\textsc{POOL} clusters query stems with overlaps, evaluates a base estimator on representative medoids, softly propagates confidence scores to nearby queries, and selectively evaluates high-disagreement cases. We instantiate this framework with \textsc{Hy@}$p$, a hybrid estimator that combines verbal confidence with spectral answer diversity computed from the negative von Neumann entropy of sampled answer embeddings.Across six domains from three datasets and five black-box LLMs, \textsc{Hy@}5 achieves higher average AUROC than verbal confidence and \textsc{Vn@}10 sampling while using half as many samples as \textsc{Vn@}10. \textsc{POOL}-\textsc{Hy@}5 retains 93.5--97.9\% of its AUROC while saving 19.3--39.3\% of generations. On paraphrase-dense workloads, generation savings rise to 73-76\%, showing that semantic redundancy can be leveraged to lower confidence-estimation costs.