Decomposed Entailment for Factuality Checking and Hallucination Detection

📄 arXiv: 2608.05823v1 📥 PDF

作者: Achir Oukelmoun, Nasredine Semmar, Gaël De Chalendar

分类: cs.CL

发布日期: 2026-08-06


💡 一句话要点

提出HallDetect以解决大型语言模型的事实性检查与幻觉检测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 幻觉检测 事实性检查 大型语言模型 内容生成 机器学习

📋 核心要点

  1. 现有大型语言模型在生成内容时常出现事实不一致和幻觉现象,影响其可靠性。
  2. HallDetect通过将生成内容分解为原子声明,利用对比形式的蕴含模型进行验证,从而实现幻觉检测。
  3. 在控制实验中,HallDetect在多个基准测试中表现优异,超越了同类方法,且稳定性良好。

📝 摘要(中文)

大型语言模型(LLMs)的可靠性常因事实不一致而受到影响,尤其是幻觉现象,即生成内容未得到基础来源支持。本文提出了HallDetect,一个轻量级、无参考和黑箱的幻觉检测框架,评估范围不仅限于摘要生成,还涵盖更广泛的源基础生成设置。HallDetect基于分解的事实性评估,将生成内容分解为原子声明,通过对多尺度源块库的对比形式,利用紧凑的编码器基础的蕴含模型进行验证,并通过不对称评分聚合,单个自信的矛盾声明即可标记响应。在控制协议下,HallDetect在三个基准测试中超越了同等资源的生成和嵌入基线,并在不同的骨干网络上保持稳定,生成声明到跨度的审计轨迹以定位每个错误。

🔬 方法详解

问题定义:本文旨在解决大型语言模型生成内容中的事实性检查和幻觉检测问题。现有方法往往依赖于参考数据,难以在无参考情况下有效检测幻觉现象。

核心思路:HallDetect的核心思路是将生成内容分解为多个原子声明,通过对每个声明进行独立验证,确保整体内容的事实性。这种设计允许在不依赖外部参考的情况下进行有效的幻觉检测。

技术框架:HallDetect的整体架构包括内容分解、声明验证和结果聚合三个主要模块。首先,将生成的文本分解为原子声明;其次,利用编码器基础的蕴含模型对每个声明进行验证;最后,通过不对称评分机制聚合验证结果。

关键创新:HallDetect的主要创新在于其分解式的事实性评估方法,允许在黑箱环境中进行有效的幻觉检测。这与传统方法依赖于完整文本的验证方式形成鲜明对比。

关键设计:在设计中,HallDetect采用了紧凑的编码器模型,并通过对比损失函数来优化声明的验证过程。此外,使用多尺度源块库增强了模型的鲁棒性和准确性。通过不对称评分机制,单个矛盾声明即可标记整个响应的错误。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在实验中,HallDetect在三个基准测试中超越了同等资源的生成和嵌入基线,表现出色。具体而言,在四个基准中,HallDetect在三个基准上取得了显著的性能提升,且在不同骨干网络上保持稳定性,显示出其广泛适用性。

🎯 应用场景

HallDetect的潜在应用场景包括新闻生成、社交媒体内容审核和自动化文档生成等领域。其能够有效检测生成内容的事实性,提升信息的可靠性,具有重要的实际价值和未来影响。随着大型语言模型的广泛应用,HallDetect的技术将为内容生成的可信度提供保障。

📄 摘要(原文)

The reliability of Large Language Models (LLMs) is often compromised by factual inconsistencies, including hallucinations---cases where generated content is not supported by the underlying source. We present HallDetect, a lightweight, reference-free, and black-box framework for hallucination detection that we evaluate not only on summarization but across a broader range of source-grounded generation settings. HallDetect builds on decomposition-based factuality evaluation: generated content is decomposed into atomic claims, each verified by a compact encoder-based entailment model through a contrastive formulation over a multi-scale library of source chunks, and aggregated with an asymmetric score in which a single confidently contradicted claim flags the response. Under a controlled protocol in which all methods share the same 4-bit quantized backbones and consumer-grade hardware budget, HallDetect outperforms comparably resourced generative and embedding-based baselines on three of four benchmarks while remaining stable across backbone families, and yields a claim-to-span audit trail that localizes each error.