When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models

📄 arXiv: 2609.02438v1 📥 PDF

作者: Smitha Muthya Sudheendra, Jaideep Srivastava

分类: cs.CL, cs.LG

发布日期: 2026-09-02


💡 一句话要点

探讨语言模型中的逻辑有效性与行为表现的关系

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 逻辑推理 语言模型 有效性表示 行为表现 深度学习

📋 核心要点

  1. 现有大型语言模型在逻辑推理方面的表现与其内部表示之间存在显著差距,导致对模型能力的理解不足。
  2. 本文通过分析五种变换器模型,提出了一种新的方法来研究逻辑有效性与模型内部表示之间的关系。
  3. 实验结果显示,尽管模型在行为上表现不佳,逻辑有效性仍可从隐藏状态中强解码,揭示了模型输出与内部表示的脱节。

📝 摘要(中文)

大型语言模型在逻辑推理方面表现出一定能力,但仅凭正确或错误的答案无法揭示模型内部的表示。本文研究了五种开放权重的变换器模型,使用匹配的有效-无效前提-主张对,涵盖不同推理类型、语义领域、模板和难度级别。尽管行为表现接近随机,逻辑有效性通常可以从隐藏状态中几乎完美解码,并在保留的模板、领域和推理类型下保持强解码能力。有效性在行为上不正确的示例中也高度可解码,尤其是在正确性条件评估明确的情况下。同时,全面的逐一排除测试揭示了这种泛化的明显限制,沿着探测导出的有效性方向的干预效果较弱且不具特异性。我们的结果表明,表示有效性、在行为中表达有效性以及因果使用有效性是不同的。有效性相关信息可以从模型的隐藏状态中强解码,但在输出中并不可靠地表达。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在逻辑推理中的有效性表示与行为表现之间的矛盾,现有方法未能充分揭示模型内部的逻辑有效性。

核心思路:通过使用匹配的有效-无效前提-主张对,分析模型的隐藏状态与输出之间的关系,探讨逻辑有效性如何在不同条件下被解码。

技术框架:研究采用了五种开放权重的变换器模型,进行逻辑有效性验证,实验设计包括多种推理类型、语义领域和难度级别的匹配对。

关键创新:本研究的创新在于揭示了逻辑有效性信息可以在模型的隐藏状态中强解码,但在输出中却未必可靠地表现,挑战了传统对模型能力的理解。

关键设计:实验中采用了逐一排除测试方法,评估模型在不同条件下的有效性解码能力,并分析了探测导出的有效性方向的干预效果。通过这些设计,研究揭示了模型输出与内部表示之间的复杂关系。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,尽管模型在行为上接近随机表现,逻辑有效性仍能在隐藏状态中几乎完美解码。逐一排除测试显示,模型在特定条件下的有效性解码能力显著,但干预效果较弱,表明输出与内部表示之间的脱节。

🎯 应用场景

该研究为理解大型语言模型的内部机制提供了新的视角,潜在应用于模型的改进和优化,尤其是在需要逻辑推理的任务中。未来,研究结果可能推动更有效的模型设计,提升其在复杂推理任务中的表现。

📄 摘要(原文)

Large language models can look capable of logical reasoning, but correct or incorrect answers alone tell us little about what the model represents internally. We study logical verification in five open-weight transformer models using matched valid--invalid premise--claim pairs that vary across inference families, semantic domains, templates, and difficulty levels. Despite near-chance behavioral performance, logical validity is often almost perfectly decodable from hidden states and remains strongly decodable under held-out templates, domains, and inference families. Validity also remains highly decodable on behaviorally incorrect examples in the conditions where correctness-conditioned evaluation is well defined. At the same time, exhaustive leave-one-out tests reveal clear limits to this generalization, and interventions along probe-derived validity directions have only weak, nonspecific effects compared with random controls. Our results suggest that representing validity, expressing it in behavior, and using it causally are distinct. Validity related information can be strongly decodable from a model's hidden states without being reliably expressed in its output.