Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning

📄 arXiv: 2608.22839v1 📥 PDF

作者: Shuting Xie, Nathaniel Lesperance, Graham W. Taylor

分类: cs.LG, cs.AI

发布日期: 2026-08-24

🔗 代码/项目: GITHUB


💡 一句话要点

提出层次感知监督不确定性估计以解决黑箱LLM分类推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 不确定性估计 层次分类 大型语言模型 生物多样性监测 监督学习 生态系统管理 科学决策支持

📋 核心要点

  1. 现有方法在黑箱LLM环境中难以提供可靠的置信度估计,尤其是在处理复杂的层次分类任务时。
  2. 本文提出了一种层次感知的监督学习方法,通过训练轻量级估计器来预测不同等级的正确性,从而提高不确定性估计的准确性。
  3. 实验结果表明,所提出的方法在微观AUROC上从0.57提升至0.75-0.80,显著优于传统的token似然基线,验证了方法的有效性。

📝 摘要(中文)

大型语言模型(LLMs)在科学决策支持中越来越多地被使用,但在黑箱环境中可靠的置信度估计仍然困难。本文研究了在长尾生物多样性监测流程中,由黑箱LLM生成的层次分类推理的不确定性估计。通过使用开源工具LLM提取的代理特征,我们训练了轻量级的监督估计器,采用层次感知的监督来预测等级正确性。在三个工具LLM上,监督估计器在微观区分和单一全局拒绝阈值下的选择性预测中,始终优于基于token似然的基线,微观AUROC从0.57提升至0.75至0.80。最佳结果由特定等级的多头设计(H3)实现,表明在需要统一拒绝规则时,考虑层次输出结构的重要性。

🔬 方法详解

问题定义:本文旨在解决在黑箱大型语言模型(LLM)中进行层次分类推理时的不确定性估计问题。现有方法在处理复杂的层次结构时,往往无法提供可靠的置信度,导致决策支持的准确性不足。

核心思路:论文提出了一种层次感知的监督学习框架,通过利用开源工具LLM提取的代理特征,训练轻量级的监督估计器,以预测不同等级的正确性,从而提高不确定性估计的准确性。

技术框架:整体架构包括特征提取、监督学习和不确定性估计三个主要模块。首先,通过开源工具提取特征,然后使用这些特征训练监督估计器,最后进行层次分类推理和不确定性评估。

关键创新:最重要的技术创新在于引入层次感知的监督机制,特别是采用特定等级的多头设计(H3),使得模型能够更好地适应层次输出结构,从而在统一拒绝规则下提升性能。

关键设计:在模型设计中,采用了轻量级的网络结构,设置了适当的损失函数以优化等级预测的准确性,并通过多头设计实现了对不同等级的独立处理,增强了模型的灵活性和适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的层次感知监督估计器在微观AUROC上从0.57提升至0.75-0.80,显著优于传统的token似然基线。这一提升验证了层次结构在不确定性估计中的重要性,尤其是在需要统一拒绝规则的场景下。

🎯 应用场景

该研究的潜在应用领域包括生物多样性监测、生态系统管理和科学决策支持等。通过提高不确定性估计的可靠性,能够为科学研究和政策制定提供更为精准的支持,未来可能在环境保护和资源管理中产生深远影响。

📄 摘要(原文)

Large language models (LLMs) are increasingly used for scientific decision support, yet reliable confidence estimation remains difficult in black-box settings. We study uncertainty estimation for hierarchical taxonomic reasoning generated by a black-box LLM in a long-tailed biodiversity monitoring pipeline. Using proxy features extracted by an open-source tool LLM, we train lightweight supervised estimators with hierarchy-aware supervision to predict rank-wise correctness. Across three tool LLMs, the supervised estimators consistently outperform a token-likelihood baseline for micro discrimination and selective prediction under a single global rejection threshold, improving micro AUROC from 0.57 to 0.75--0.80. The best results are achieved by a rank-specific multi-head design (H3), suggesting that accounting for hierarchical output structure is important when a unified abstention rule is required. Our code is publicly available at https://github.com/uoguelph-mlrg/hierarchy-aware-llm-uq