Calibrating Small Language Models for Claim Check-Worthiness Detection
作者: Pratuat Amatya, Venktesh Viswanathan, Vinay Setty
分类: cs.CL, cs.AI
发布日期: 2026-08-31
💡 一句话要点
提出NN-PPI以解决小型语言模型的准确性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 小型语言模型 自动化事实检查 模型校准 后处理层 性能提升
📋 核心要点
- 现有方法在处理每个传入声明时,使用大型语言模型面临成本和延迟的挑战,而小型模型则无法提供足够的准确性。
- 论文提出了NN-PPI,一种在推理时校准模型预测的轻量级后处理层,避免了重新训练基础模型的需求。
- 实验结果显示,NN-PPI在不同基线模型上实现了12%到33.80%的F1加权得分提升,显著提高了小型模型的性能。
📝 摘要(中文)
评估声明的可查证性是自动事实检查流程中的重要第一步。本研究受到早期创业公司实际部署挑战的启发:对每个传入声明运行大型语言模型(LLMs)在成本和延迟上都不可行,而较小模型则牺牲了准确性。我们提出了NN-PPI,这是一种Prediction-Powered Inference(PPI)的点对点扩展,能够在推理时对模型预测进行校准,作为轻量级的后处理层,而无需重新训练基础模型。NN-PPI在基线模型的大小和性能不同的情况下,F1加权得分提升范围为12%到33.80%,使小型语言模型的表现与大型语言模型相当。除了少量示例的小型语言模型,NN-PPI还进一步改善了生产部署的微调模型,证明了残差校准与监督微调是互补的。通过从成本低廉的模型中恢复LLM级别的准确性,使得大规模运营中准确的可查证性检测变得更加经济。
🔬 方法详解
问题定义:本论文旨在解决在自动事实检查中,如何有效评估声明的可查证性。现有方法依赖大型语言模型,导致成本和延迟问题,而小型模型则无法达到所需的准确性。
核心思路:论文提出NN-PPI作为一种轻量级的后处理层,能够在推理阶段对模型的预测进行校准,从而提高小型语言模型的准确性,而无需重新训练基础模型。
技术框架:NN-PPI的整体架构包括输入声明的处理、模型预测的生成、后处理校准层的应用以及最终的可查证性评估。主要模块包括基础模型、校准层和评估模块。
关键创新:NN-PPI的最大创新在于其能够在不重新训练基础模型的情况下,通过后处理校准显著提升小型模型的性能。这一方法与传统的微调方法本质上不同,后者需要大量的计算资源和时间。
关键设计:在设计NN-PPI时,采用了特定的损失函数以优化校准效果,并在网络结构上进行了调整,以确保校准层能够有效地与基础模型结合,提升预测的准确性。具体的参数设置和网络结构细节在论文中有详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,NN-PPI在不同基线模型上实现了12%到33.80%的F1加权得分提升,使小型语言模型的性能与大型语言模型相当。这一显著提升证明了NN-PPI在实际应用中的有效性和重要性。
🎯 应用场景
该研究的潜在应用领域包括新闻媒体、社交媒体平台和任何需要自动化事实检查的系统。通过降低成本和提高准确性,NN-PPI能够使得大规模的可查证性检测变得更加可行,促进信息的真实性和可靠性。未来,随着模型和技术的进一步发展,NN-PPI可能会在更广泛的领域中得到应用。
📄 摘要(原文)
Assessing claim check-worthiness is an essential first step in automated fact-checking pipelines. This work is motivated by a real deployment challenge at an early-stage startup: running large language models (LLMs) over every incoming claim is cost- and latency-prohibitive, yet smaller models sacrifice accuracy. We propose NN-PPI, a pointwise extension of Prediction-Powered Inference (PPI) that calibrates model predictions at inference time as a lightweight post-hoc layer, without re-training the underlying model. NN-PPI achieves weighted F1 gains ranging from 12% to 33.80% depending on the size and performance of the baseline model, bringing SLMs on par with larger LLMs. Beyond few-shot SLMs, NN-PPI further improves a production-deployed fine-tuned model, demonstrating that residual calibration is complementary to supervised fine-tuning. By recovering LLM-level accuracy from models that are an order of magnitude cheaper to serve, it makes accurate check-worthiness detection substantially cheaper to operate at scale. Our code and data can be found at https://anonymous.4open.science/r/arr-claim-worthiness-F237.