Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages

📄 arXiv: 2608.18545v1 📥 PDF

作者: Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer

分类: cs.CL

发布日期: 2026-08-19

备注: 25 pages including appendices, 16 figures. Accepted to COLM 2026


💡 一句话要点

提出共享电路以追踪跨语言主谓一致性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多语言模型 主谓一致性 激活补丁 注意力分析 形态句法 跨语言共享 自然语言处理

📋 核心要点

  1. 现有研究未能明确多语言模型中主谓一致性共享的出现时机及其与语法操作显性表现的关系。
  2. 通过激活补丁和注意力分析,论文探讨了29种语言中的主谓一致性电路,揭示了其跨语言的共享机制。
  3. 研究发现,显性人称/数变位语言在一致性电路上表现出更高的相似性,英语在特定上下文中与变位语言的相似性增强。

📝 摘要(中文)

多语言大型语言模型通常在语言间具有一定的泛化能力,然而其内部机制何时出现共享以及这种共享是否因语法操作的显性表现而异仍不清楚。本文研究了现时态主谓一致性这一形态句法过程,发现具有显性人称/数的语言在一致性电路上表现出更高的相似性,而非变位语言则相对较弱。通过激活补丁和注意力分析,比较了29种语言和五个开源模型家族的注意力头,结果表明,英语在需要显性一致的上下文中与变位语言的相似性增强。这些发现表明,多语言LLM重用部分共享的计算结构来处理形态句法一致性,而非依赖完全独立的语言特定解决方案。

🔬 方法详解

问题定义:本文旨在解决多语言大型语言模型中主谓一致性共享的时机及其与语法操作显性表现之间的关系。现有方法未能充分探讨这一问题的复杂性和多样性。

核心思路:通过激活补丁和注意力分析,论文识别出与主谓一致性相关的注意力头,并比较不同语言之间的相似性,以揭示共享机制。

技术框架:研究采用了激活补丁技术和注意力分析,分析了29种语言的五个开源模型家族,重点关注与主谓一致性相关的注意力头。

关键创新:论文的创新在于通过跨语言比较,揭示了具有显性人称/数变位的语言在一致性电路上的相似性,提出了共享计算结构的概念。

关键设计:研究中使用了多种语言的注意力头进行比较,特别关注了显性一致性在不同语言中的表现,采用了特定的激活补丁技术以确保分析的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,具有显性人称/数变位的语言在主谓一致性电路上表现出更高的相似性,尤其在分析中隔离了变位对比的恢复时。英语在需要显性一致的上下文中与变位语言的相似性显著增强,显示出跨语言模型的共享机制。

🎯 应用场景

该研究的潜在应用领域包括多语言自然语言处理、机器翻译和跨语言学习等。通过理解不同语言间的共享机制,可以提升多语言模型的性能和泛化能力,推动人工智能在多语言环境中的应用。未来,研究成果可能为语言学习和跨文化交流提供新的视角和工具。

📄 摘要(原文)

Multilingual large language models often generalize across languages, and prior work suggests that their internal mechanisms can overlap cross-lingually. It remains unclear, however, when such sharing emerges and whether it varies with the overt realization of the same grammatical operation. We investigate this question for present-tense subject-verb agreement, a morphosyntactic process that varies substantially across languages and is only weakly expressed in English. Using activation patching and attention analysis across 29 languages and five open-source model families, we identify the attention heads causally implicated in agreement and compare these head-level signatures across languages. We find that languages with overt person/number inflection exhibit more similar agreement circuitry than non-conjugating languages, with the strongest sharing appearing when the analysis isolates recovery of the inflectional contrast itself. English provides an informative bridge case, becoming more similar to conjugating languages precisely in contexts where overt agreement is required. Finally, many implicated heads display similar attention patterns across languages, suggesting that cross-lingual overlap reflects shared functional roles as well as shared localization. Together, these results indicate that multilingual LLMs reuse partially shared computational structure for morphosyntactic agreement rather than relying on fully separate language-specific solutions.