Divergent large language model predictions from convergent representations in ambiguous word pairs

📄 arXiv: 2608.01816v1 📥 PDF

作者: K. Jack Scott, Narun Pat, Veronica Liesaputra

分类: cs.CL

发布日期: 2026-08-03

备注: 21 main text pages, 20 pages supplemental, 4 figures


💡 一句话要点

通过层级分析揭示解码器模型处理词义歧义的机制

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 解码器模型 词义歧义 层级分析 KL散度 激活补丁实验 自然语言处理 语义搜索

📋 核心要点

  1. 现有解码器模型在处理词义歧义时,内部表示与最终输出之间的关系尚不明确,导致理解困难。
  2. 论文通过逐层分析不同参数规模的解码器模型,揭示了模型在处理同音异义词和多义词时的表示变化机制。
  3. 实验结果表明,尽管后期层的表示相似性增加,模型的输出依然受到表示差异的影响,提供了新的理解视角。

📝 摘要(中文)

本研究探讨了解码器模型如何通过逐层分析解决词汇歧义,涉及三种不同参数规模的模型(GPT-2-Small-117M、Llama-3.2-3B、Qwen2.5-32B)。研究发现,对于同音异义词和多义词,模型在中间层的表示最为明显,但在后期层次部分重新聚合,而其下一个词预测的KL散度在最后层达到最大。激活补丁实验提供了因果证据,表明尽管嵌入空间的相似性增加,后期层的表示差异直接决定了输出。单层消融实验显示,尽管层级脆弱性不同,模型在消歧义方面表现相当。这些发现为模型内部嵌入相似性与行为输出之间的低相关性提供了机制,影响了基于嵌入的方法如语义搜索和聚类。

🔬 方法详解

问题定义:本研究旨在解决解码器模型在处理词义歧义时,内部表示与输出之间关系不明确的问题。现有方法未能充分揭示模型在不同层次的表现差异及其对输出的影响。

核心思路:论文通过逐层分析不同参数规模的解码器模型,探讨模型如何在处理同音异义词和多义词时,表现出不同的表示特征和输出结果。通过激活补丁实验,验证了后期层的表示差异对输出的直接影响。

技术框架:研究采用了三种不同规模的解码器模型进行比较,分析其在处理词义歧义时的层级表示变化。主要模块包括模型训练、逐层分析、激活补丁实验和单层消融实验。

关键创新:最重要的创新在于揭示了模型在中间层的表示最为明显,而后期层的相似性增加却不影响输出的准确性。这一发现挑战了传统的嵌入相似性与输出相关性的理解。

关键设计:研究中采用了KL散度来衡量不同词的下一个词预测的差异,并设计了激活补丁实验以提供因果证据。此外,单层消融实验显示不同层次的脆弱性对消歧义能力的影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,模型在中间层的表示差异最大,而在后期层的相似性增加并未影响输出的准确性。KL散度在最后层达到最大,表明模型在处理同音异义词和多义词时的表现具有一致性。单层消融实验结果显示,尽管层级脆弱性不同,模型的消歧义能力依然相当。

🎯 应用场景

该研究的结果对自然语言处理领域具有重要的应用价值,尤其是在语义搜索、信息检索和文本聚类等任务中。通过理解模型的内部表示机制,可以优化模型设计,提高其在处理复杂语言现象时的性能,未来可能推动更智能的对话系统和自动翻译工具的发展。

📄 摘要(原文)

In this work we investigate how decoder-only transformers resolve lexical ambiguity through layer-by-layer analysis of three models spanning three parameter sizes (GPT-2-Small-117M, Llama-3.2-3B, Qwen2.5-32B). For both homonyms and polysemes, we find that representations become maximally distinct in middle layers, then partially reconverge in late layers, while the KL divergence between their next-token predictions reaches its maximum in the final layers. The activation patching experiment provides causal evidence that late-layer representational differences directly determine outputs despite apparent increased similarity in embedding space. Our single-layer ablation experiment indicates that models achieve equivalent disambiguation despite qualitatively different layer-wise vulnerabilities. These findings offer a mechanism for recent observations where models' internal embedding similarities show low correlation with their behavioural outputs despite strong performance. The semantic distinctions therefore remain present but become increasingly invisible to similarity measures over the embeddings, with implications for embedding-based methods such as semantic search, retrieval, and clustering that rely on late-layer cosine similarity.