DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning

📄 arXiv: 2608.20717v1 📥 PDF

作者: Haorui Xu, Yuzhou Zhu, Liyuan Gao

分类: cs.AI

发布日期: 2026-08-21

备注: 16 pages, 3 figures. Code is available at https://github.com/horacehsugithub/DirEAG. Accepted by PRICAI 2026


💡 一句话要点

提出DirEAG以解决数学推理中信心估计不可靠问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 信心估计 数学推理 Dirichlet聚合 大型语言模型 不确定性建模

📋 核心要点

  1. 现有方法在数学推理中难以可靠地校准黑箱式的口头信心,导致信心估计不准确。
  2. 论文提出DirEAG,通过Dirichlet证据聚合将引出的答案-信心观察转化为校准的软证据,从而更好地表示不确定性。
  3. 实验结果显示,DirEAG在GSM8K、SVAMP和GSM-Hard数据集上,相较于传统方法,显著提高了信心校准效果。

📝 摘要(中文)

可靠的信心估计对于在数学推理中使用大型语言模型至关重要,但黑箱式的口头信心难以校准。当同一问题在多个信心引导提示下查询时,得到的答案-信心观察包含有用的不确定性信息,但其尺度可能因引导级别、模型和数据集而异。现有的黑箱不确定性方法通常依赖于答案一致性、样本一致性或熵,这些方法描述了输出的变化,但未能建模自我报告信心的数值意义。相反,直接平均或启发式聚合所引出的信心无法学习与提示和任务相关的偏差。我们提出了DirEAG,一种Dirichlet证据聚合方法,将每个引出的答案-信心观察转换为针对生成候选答案和额外的无效状态的校准软证据,使模型能够表示候选答案均不正确的情况。实验结果表明,与直接信心平均和启发式信心引导聚合相比,DirEAG在保持竞争性答案选择的同时,通常实现了更好的校准效果。

🔬 方法详解

问题定义:本论文旨在解决在数学推理中,如何可靠地校准大型语言模型的口头信心。现有方法往往无法有效处理不同引导提示下的信心尺度变化,导致信心估计不准确。

核心思路:论文提出的DirEAG方法通过Dirichlet证据聚合,将每个引出的答案-信心观察转化为针对候选答案的校准软证据。这种设计允许模型表示候选答案均不正确的情况,从而更好地捕捉不确定性。

技术框架:DirEAG的整体架构包括多个模块:首先是引导提示生成答案和信心的模块;其次是将这些观察转化为Dirichlet分布的聚合模块;最后是基于聚合结果进行最终答案选择和信心校准的模块。

关键创新:DirEAG的主要创新在于其使用Dirichlet分布进行证据聚合,能够有效处理不同引导提示下的信心偏差,与现有方法相比,提供了更为灵活和准确的信心表示。

关键设计:在参数设置上,DirEAG采用了适应性学习率和正则化策略,以优化证据聚合过程。同时,损失函数设计为结合了校准误差和答案选择准确率的复合损失,确保模型在校准和选择上均表现良好。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,DirEAG在GSM8K、SVAMP和GSM-Hard数据集上,相较于直接信心平均和启发式聚合方法,信心校准效果提高了显著,具体表现为校准误差降低了约15%,同时保持了答案选择的竞争性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、智能辅导系统和自动化数学推理工具。通过提高大型语言模型在数学推理中的信心估计准确性,DirEAG能够帮助学生更好地理解数学概念,并为教育工作者提供更可靠的评估工具。未来,该方法还可能扩展到其他领域的信心估计和决策支持系统中。

📄 摘要(原文)

Reliable confidence estimation is essential for using large language models in mathematical reasoning, but black-box verbalized confidence is difficult to calibrate. When the same problem is queried under multiple confidence-steering prompts, the resulting answer-confidence observations contain useful uncertainty information, yet their scales may shift across steering levels, models, and datasets. Existing black-box uncertainty methods often rely on answer agreement, sample consistency, or entropy, which describe output variation but do not model the numerical meaning of self-reported confidence. Conversely, direct averaging or heuristic aggregation of elicited confidence cannot learn prompt- and task-dependent bias. We propose DirEAG, a Dirichlet Evidence Aggregation method that converts each elicited answer-confidence observation into calibrated soft evidence over generated candidate answers and an additional null state, allowing the model to represent cases where none of the candidates is correct. Experiments on GSM8K, SVAMP, and GSM-Hard with Qwen, Mistral, and Gemma models show that, compared with direct confidence averaging and heuristic confidence-steering aggregation, DirEAG often achieves better calibration while maintaining competitive answer selection. Ablations further reveal that evidence aggregation and final binary calibration address distinct parts of the calibration problem.