HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

📄 arXiv: 2608.16353v1 📥 PDF

作者: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

分类: cs.CL, cs.AI

发布日期: 2026-08-17


💡 一句话要点

提出HalluTracer以解决语言模型幻觉检测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 幻觉检测 深度学习 语言模型 真实性信号 聚合方法 几何分析 白盒检测

📋 核心要点

  1. 现有的幻觉检测方法往往将证据压缩为孤立的组件,导致重要信息的丢失。
  2. HalluTracer通过在模型生成答案之前聚合每层的真实性信号,提升了检测的准确性。
  3. 在多个基准测试中,HalluTracer的性能提升显著,超越了现有的白盒检测器。

📝 摘要(中文)

即使是经过良好对齐的大型语言模型也会自信地生成事实错误的文本,使得幻觉成为高风险应用中的持续可靠性风险。然而,这些模型在其内部表示中仍然携带线性可分的真实性信号。现有的白盒检测器将这些证据压缩为孤立的组件或单一深度,丢弃了分布在整个前向传播过程中的判别信息。我们提出了HalluTracer,一个检测框架,在模型发出任何答案标记之前,读取并聚合每一层的真实性证据。几何分析表明,每层信号之间的相关性较弱,因此简单的深度平均可以抑制层特定的噪声,并捕获几乎所有线性可访问的信息。在六个开源语言模型和五个幻觉基准测试中,HalluTracer始终优于匹配的白盒基线,提升幅度从一到十四点不等。总体而言,我们的工作将幻觉检测从层选择问题重新定义为由真实性信号的几何稀疏性主导的深度聚合问题。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型中幻觉检测的挑战,现有方法往往忽视了分布在各层的真实性信号,导致检测效果不佳。

核心思路:HalluTracer的核心思路是聚合模型每一层的真实性证据,而不是仅依赖于单一层的信息,从而更全面地捕捉到幻觉的信号。

技术框架:HalluTracer的整体架构包括多个模块,首先是前向传播过程中的信号提取,然后是信号的深度平均处理,最后是基于聚合结果的幻觉检测。

关键创新:HalluTracer的主要创新在于将幻觉检测从层选择问题转变为深度聚合问题,通过几何分析揭示了每层信号的稀疏性,显著提高了检测的准确性。

关键设计:在设计中,HalluTracer采用了简单的深度平均策略来抑制层特定的噪声,确保了聚合信号的有效性,具体的参数设置和损失函数设计未在摘要中详细说明,待进一步研究。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

HalluTracer在六个开源语言模型和五个幻觉基准测试中表现出色,性能提升幅度在一到十四点之间,显著优于现有的白盒基线。这一结果表明,深度聚合方法在幻觉检测中具有重要的应用潜力。

🎯 应用场景

HalluTracer的研究成果在多个高风险领域具有潜在应用价值,如医疗文本生成、法律文书撰写和金融报告等。这些领域对信息的真实性要求极高,HalluTracer能够有效提升生成文本的可靠性,减少错误信息的传播。未来,该技术可能会与其他AI系统结合,进一步增强其应用范围和效果。

📄 摘要(原文)

Even well-aligned large language models confidently generate factually incorrect text, making hallucination a persistent reliability risk in high-stakes deployments. These models nonetheless carry linearly separable truthfulness signals in their internal representations. Existing white-box detectors, however, collapse this evidence to isolated components or a single depth, discarding discriminative information distributed across the full forward pass. We introduce HalluTracer, a detection framework that reads and aggregates truthfulness evidence across every layer of the forward pass before the model emits any answer token. A geometric analysis reveals that the per-layer signals are weakly correlated, so that simple depth averaging suppresses layer-specific noise and captures nearly all linearly accessible information. Across six open-source language models and five hallucination benchmarks, HalluTracer consistently outperforms matched white-box baselines, with gains ranging from one to fourteen points. Collectively, our work recasts hallucination detection from a layer-selection problem into a depth-aggregation problem governed by the geometric sparsity of the truthfulness signal.