Knowing Is Not Enough: Information Retrievability as a Precondition to Effective LLM Oversight

📄 arXiv: 2609.01976v1 📥 PDF

作者: Xinyu Fu, Narayan Ramasubbu, Dennis Galletta

分类: cs.HC, cs.AI

发布日期: 2026-09-02


💡 一句话要点

提出信息可检索性以增强大型语言模型的人工监督效果

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 人工监督 信息可检索性 错误检测 用户体验 认知心理学 实验研究

📋 核心要点

  1. 现有方法未能有效解决大型语言模型输出错误的人工审查问题,导致错误未被及时发现。
  2. 本文提出通过增强信息的可检索性来改善人工监督效果,强调在审查时相关信息的即时可获取性。
  3. 实验结果显示,自我生成的解释和提示能够显著提高错误检测率,增强用户的验证推理回忆能力。

📝 摘要(中文)

大型语言模型(LLMs)在组织工作中越来越普遍,但其错误常常未能通过人工审查。以往研究将此类失败归因于用户对LLM输出的审查能力不足。本文提出了一种基于检索的人工监督模型,认为在审查时,相关信息的可获取性是有效错误检测的前提。通过对640名客户服务员工进行的两项随机实验,结果表明,自我生成的解释能够提高错误检测率,并增强验证相关推理的回忆,而能够重新激活这些推理的提示则有助于在重复使用LLM时维持检测效果。理论上,本文将信息可检索性定义为有效监督的一个独特前提,并明确了生成编码和提示支持的再激活作为构建和维持这一前提的机制。实践中,轻量级的自我解释和日常检索提示可以使人工监督在LLM使用日常化的情况下更加稳健。

🔬 方法详解

问题定义:本文旨在解决大型语言模型(LLMs)在组织工作中产生的错误未能被有效审查的问题。现有方法主要依赖用户的审查能力,但往往未能考虑信息的可获取性对审查效果的影响。

核心思路:论文提出信息可检索性作为有效监督的前提,认为在审查过程中,用户能够即时获取相关信息会显著提高错误检测的效果。通过自我生成的解释和提示,增强用户的认知能力和信息回忆。

技术框架:研究采用随机实验设计,参与者为640名客户服务员工,实验分为两个阶段:第一阶段为自我解释生成,第二阶段为提示支持的再激活。通过对比实验组和对照组的表现,评估信息可检索性对错误检测的影响。

关键创新:最重要的创新点在于将信息可检索性定义为有效监督的独特前提,并提出生成编码和提示支持的再激活作为实现这一目标的机制。这一理论框架为后续研究提供了新的视角。

关键设计:实验中使用了自我生成的解释作为轻量级的培训工具,并设计了日常检索提示,以增强用户在重复使用LLM时的错误检测能力。具体的参数设置和提示内容根据实验反馈进行调整,以确保最佳效果。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,自我生成的解释使错误检测率提高了显著的百分比,而提示支持的再激活则在重复使用LLM时保持了较高的检测效果。这表明信息可检索性在人工监督中的重要性,提供了新的实证支持。

🎯 应用场景

该研究的潜在应用领域包括客户服务、内容审核和任何依赖大型语言模型的组织工作。通过增强人工监督的有效性,可以降低因模型错误导致的风险,提高工作效率和决策质量。未来,随着LLM的广泛应用,该方法有望在多个行业中推广,提升人机协作的效果。

📄 摘要(原文)

Large language models (LLMs) are increasingly embedded in organizational work, yet their errors often pass human review. Prior research locates such failures in users' capability to review LLM output or their engagement in doing so. We develop an alternative, retrieval-based account of human oversight and posit that error detection is more effective when oversight-relevant information is accessible to users at the moment of review. Across two randomized lab-in-the-field experiments with 640 customer-facing employees, we show that self-generated explanations improve error detection and strengthen recall of verification-relevant reasoning, while cues that reactivate such reasoning help sustain detection under repeated LLM use. Theoretically, we identify information retrievability as a distinct precondition for effective oversight and specify generative encoding and cue-supported reactivation as mechanisms that build and sustain it. Practically, lightweight onboarding self-explanations and daily retrieval cues can make human oversight more resilient as LLM use becomes routine.