Cultural Awareness is Represented but Not Decoded: Tracing Mythological Knowledge across 18 Open-Source LLMs
作者: Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen
分类: cs.CL, cs.CY, cs.LG
发布日期: 2026-08-03
备注: 45 pages, 23 figures, 18 tables. Dataset: https://huggingface.co/datasets/Aragoner/folkmotif Code: https://github.com/AragonerUA/folkmotif
💡 一句话要点
提出跨文化知识追踪方法以解决LLM文化偏见问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 文化知识 跨文化研究 解码器 神话知识
📋 核心要点
- 现有的开源大型语言模型在处理不同文化的神话知识时表现不均,尤其在较少代表的文化中存在显著偏差。
- 论文通过对18个开源LLMs进行线性探测和激活补丁等技术,分析模型内部文化知识的表现与解码过程的关系。
- 实验结果显示,模型在文化表示上有良好区分能力,但在解码时却将文化特定的标记压缩为主流传统的标记,揭示了解码器的局限性。
📝 摘要(中文)
本文研究了18个开源大型语言模型(LLMs)在处理不同文化神话时的表现,发现这些模型在命名希腊和北欧神话中的神祇如宙斯和雷神托尔时表现良好,但在处理芬兰、斯拉夫、埃及和中国等较少代表的传统时则表现不佳。通过线性探测、激活补丁等技术,研究者揭示了模型内部文化默认的形成位置,并指出解码器在文化特定标记的处理上存在问题。研究还提供了跨文化的基准数据和模型预测,推动了对文化知识在LLMs中的理解。
🔬 方法详解
问题定义:本文旨在探讨开源大型语言模型在处理不同文化神话时的表现差异,尤其是如何在模型内部形成文化默认值,以及解码器在处理文化特定标记时的不足。现有方法未能有效区分和解码不同文化的知识,导致模型在特定文化背景下的表现不佳。
核心思路:研究者通过线性探测、激活补丁和输出提取等技术手段,分析模型内部的文化知识表示与解码过程,重点关注解码器如何处理不同语言的提示。这样的设计旨在揭示模型在文化知识处理上的潜在缺陷,特别是在多语言环境下的表现。
技术框架:整体研究流程包括数据准备、模型选择、文化知识探测和解码分析。研究者从8个不同架构的开源LLMs中选择18个模型,利用线性探测和激活补丁等技术对模型进行分析,最终提取输出并进行比较。
关键创新:本文的主要创新在于提出了一种新的分析框架,能够清晰区分模型在文化知识表示与解码过程中的表现差异。与现有方法相比,本文强调了解码器在文化特定标记处理中的局限性,提供了更深入的理解。
关键设计:在实验中,研究者设置了多种参数以优化线性探测和激活补丁的效果,使用了基于文化的基准数据进行对比分析,并设计了语言条件下的相关性测试,以评估解码器在不同语言提示下的表现。通过这些设计,研究者能够更准确地捕捉到模型在文化知识处理上的差异。
🖼️ 关键图片
📊 实验亮点
实验结果表明,模型在文化知识的表示上能够有效区分不同文化,但在解码时却将文化特定的标记压缩为主流传统的标记,显示出解码器的局限性。研究中提出的分析框架和基准数据为后续研究提供了重要参考。
🎯 应用场景
该研究为理解大型语言模型在处理文化知识时的表现提供了新的视角,尤其是在多文化和多语言环境下的应用。未来,该研究的成果可以用于改进LLMs的训练方法,使其在处理不同文化背景的信息时更加准确,从而提升模型在跨文化交流、教育和内容生成等领域的实际应用价值。
📄 摘要(原文)
Open-source LLMs reliably name Zeus, Jupiter, and Thor, but recover their counterparts in less-represented traditions like Finnish, Slavic, Egyptian, or Chinese mythology far less consistently. We ask where inside the model this cultural default is produced. On a parallel cross-cultural substrate of Thompson-motif entities, we instrument 18 open-source LLMs from 8 architecture families with linear probing, logit lens, activation patching, and output extraction. The residual stream cleanly distinguishes cultures, well above a name-string baseline, yet the decoder collapses culturally-specific tokens onto dominant-tradition ones. The failure is at readout, not at representation. Asking the same question in the target culture's native language versus English produces failures that cluster within language but decouple across language: the decoder is gated on prompt language. We release a per-entity (probe, output) decomposition framework, a citation-anchored cross-cultural ground truth, a within- versus cross-mode correlation test for language-conditioned readout, and per-entity predictions for all 18 models.