Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations
作者: Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos
分类: cs.CL
发布日期: 2026-08-27
备注: Published as a conference paper at EMNLP 2026 (Main)
💡 一句话要点
揭示双语预训练模型共享语言表示的隐藏状态差异
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多语言模型 共享语言表示 深层隐藏状态 对齐方法 跨语言迁移学习
📋 核心要点
- 现有多语言模型在对比和解释时,常假设共享语言表示是可比的,但这一假设在解码器模型中可能不成立。
- 本文通过预训练双语和单语模型,探讨了共享语言表示的隐藏状态差异,揭示了模型内部表示的复杂性。
- 实验结果显示,尽管词嵌入对齐,深层隐藏状态却存在显著差异,影响了模型在下游任务中的可互换性。
📝 摘要(中文)
在多语言模型的对比研究中,研究者通常假设共享语言表示是可比的。然而,本文表明这一假设在仅解码器模型中可能过于仓促。我们预训练了310M参数的模型(一个仅限英语,一个双语),并在八种类型多样的语言上进行测试。结果显示,尽管对齐后的词嵌入相似,但模型用于预测的深层隐藏状态却存在显著差异。这一差异在所有语言中均存在,并且在控制文档重叠和其他对齐方法后依然成立,表明嵌入对齐可能掩盖了模型内部对共享语言的真实表示差异。
🔬 方法详解
问题定义:本文旨在解决多语言模型共享语言表示的可比性问题,现有方法未能充分考虑隐藏状态的差异性,可能导致错误的模型对比和解释。
核心思路:通过预训练一个双语模型和一个仅限英语的模型,分别控制英语暴露、计算资源和文档重叠,探讨不同语言的共享表示。
技术框架:整体架构包括两个主要模块:一个是双语模型的预训练,另一个是对齐后的词嵌入和深层隐藏状态的比较分析。
关键创新:本文的主要创新在于揭示了即使在对齐词嵌入的情况下,模型的深层隐藏状态依然存在显著差异,这一发现挑战了传统的对齐假设。
关键设计:在模型训练中,采用了310M参数的结构,控制了多种变量以确保实验的严谨性,特别是在对齐方法和文档重叠的控制上。实验中使用了多种对齐方法进行比较,确保结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,尽管对齐后的词嵌入在视觉上相似,但深层隐藏状态的差异在所有八种语言中均显著存在。这一差异在中间的变换层中逐渐加大,表明其源于上下文处理,而非输入表示的对齐。
🎯 应用场景
该研究的发现对多语言模型的设计和应用具有重要影响,尤其是在跨语言迁移学习和多语言任务的模型选择中。理解共享语言表示的内部差异有助于提升模型的可解释性和性能,未来可应用于翻译、信息检索等领域。
📄 摘要(原文)
When researchers compare multilingual models for probing, interpretability, or cross-lingual transfer, they often align embedding spaces and assume that shared-language representations are comparable. We show that this assumption can be premature for decoder-only models. We pretrain paired 310M-parameter models (one English-only, one bilingual) across eight typologically diverse languages, separately controlling for English exposure, total compute, and document overlap. After aligning on shared English vocabulary, we test held-out words and find that token embeddings look similar after alignment, but the deeper hidden states that the model uses for prediction do not. This gap holds for all eight languages and survives controls for document overlap and alternative alignment methods. This hidden-state mismatch grows through middle transformer layers, suggesting that it arises from contextual processing rather than the input representations where alignment is performed. Embedding alignment can mask real differences in how models internally represent a shared language, which matters for any downstream study that treats aligned models as interchangeable.