Proxy reliance in large language model decisions is uncalibrated to predictive evidence

📄 arXiv: 2608.22887v1 📥 PDF

作者: Zengqing Wu, Chuan Xiao

分类: cs.AI, cs.CL, cs.CY

发布日期: 2026-08-24


💡 一句话要点

提出代理依赖性评估方法以解决大语言模型决策不准确问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 代理依赖性 决策审计 因果推理 医疗决策 金融信贷 社会公平 模型评估

📋 核心要点

  1. 现有的审计方法未能有效区分合理推理与不当代理使用,导致决策的准确性受到影响。
  2. 论文提出了一种新的审计信号,通过测量因果代理效应来评估大语言模型的决策依赖性。
  3. 实验结果显示,模型在不同条件下的代理依赖性存在显著差异,且准确性评估未能反映真实情况。

📝 摘要(中文)

大语言模型(LLMs)在分诊和贷款等决策中逐渐被应用,其中任务相关推理必须与不当的代理使用区分开来。目前的审计方法主要关注当人口统计特征变化时决策是否改变。然而,与受保护群体相关的属性具有预测价值,因此决策的变化可能是歧视或合理推理的结果。本文在已知真实结果的临床排名任务中,测量了四个LLMs的因果代理效应,计算出证据所需的依赖程度并作为参考。通过一种审计信号得出三种裁决:过度依赖、合理依赖和不足依赖。在中性标签下,每个模型都依赖于没有信息的代理。信息性代理则引发三种裁决。社会字段名称降低了某一模型的依赖程度。研究发现,依赖程度严重低估了证据,而社会标签抑制是脆弱的,因为上下文示例在每个模型中都将其提升至零以上。基于准确性的评估未能检测到这些问题。

🔬 方法详解

问题定义:本文旨在解决大语言模型在决策中对代理的依赖性不准确的问题。现有方法主要关注人口统计特征变化对决策的影响,但未能有效评估代理使用的合理性和准确性。

核心思路:论文通过测量因果代理效应,提出了一种新的审计信号,能够更准确地评估模型在决策中对代理的依赖程度,从而区分合理推理与不当代理使用。

技术框架:研究采用了已知真实结果的临床排名任务作为实验基础,设计了四个大语言模型进行比较。通过计算证据所需的依赖程度,建立了一个参考标准。

关键创新:最重要的技术创新在于提出了一种新的审计信号,能够在不同条件下评估模型的代理依赖性,并揭示了社会标签对依赖性的影响。与现有方法相比,该方法能够更全面地反映模型的决策过程。

关键设计:在实验中,模型的输入包括中性标签和信息性代理,设计了相应的损失函数以优化模型的决策过程。同时,研究还分析了社会字段名称对模型依赖性的影响,发现其抑制效果是脆弱的。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,在中性标签下,所有模型均依赖于无信息的代理,而信息性代理则引发了三种不同的裁决。特别是,某一模型在社会字段名称的影响下,其依赖程度显著低于参考标准。此外,研究发现,依赖程度严重低估了证据,且社会标签抑制效果脆弱。

🎯 应用场景

该研究的潜在应用领域包括医疗决策支持系统和金融信贷评估等场景。通过提高大语言模型在决策中的透明度和准确性,可以有效减少不当代理使用带来的歧视风险,从而提升社会公平性和决策质量。未来,该方法还可以扩展到其他领域,促进更广泛的AI应用。

📄 摘要(原文)

Large language models (LLMs) are entering decisions in triage and lending, where task-relevant inference must be distinguished from impermissible proxy use. Current audits ask whether decisions change when demographics change. But attributes correlated with a protected group carry predictive value, so a changed decision can be discrimination or sound inference. We measure causal proxy effects in four LLMs on a clinical-ranking task with known ground truth, where the reliance the evidence warrants can be computed exactly and used as the reference. One audit signal yields three verdicts: over-reliance, warranted and under-reliance. Under neutral labels every model relies on proxies with no information. Informative proxies draw all three. Social field names push reliance down, below the reference in one model. Two findings explain this. Reliance severely undertracks the evidence, and social-label suppression is fragile, since in-context examples raise it above zero in every model. Accuracy-based evaluation detects none of this.