Beyond "AI Language": The case for the idiolectal nature of LLM output

📄 arXiv: 2608.06589v1 📥 PDF

作者: Karolina Rudnicka, Thomas Stephan Juzek

分类: cs.CL, cs.AI

发布日期: 2026-08-06

备注: 33 pages, 6 figures, 6 tables. Submitted as a chapter to the post-workshop volume "Corpus Linguistics 2040" (Digital Linguistics series)


💡 一句话要点

提出LLM输出的个体化特征以解决AI语言分析问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 个体化特征 语言变异 文本生成 法医语言学 风格分析

📋 核心要点

  1. 现有研究将LLM输出视为统一的AI语言,忽视了模型间的个体差异,导致对语言特征的理解不足。
  2. 本研究通过分析不同时间点生成的LLM文本,提出模型特定的语言特征与人类个体语言相似,强调个体化特征的重要性。
  3. 实验结果显示,2024年与2026年模型在语言风格上存在显著差异,且每个模型的语言特征独特,收缩频率变化范围广泛。

📝 摘要(中文)

本章论证了将大型语言模型(LLM)输出视为一种集体超方言的观点与模型特定的语言特征并存。通过分析2024年和2026年生成的社会主题文本数据集,研究发现不同模型在语言风格上存在显著差异,并且每个模型保持独特的语言特征。这一多层次的互动通过收缩频率的变化得以体现,最终提出将LLM输出视为个体化特征的框架,为语言变异与变化研究、LLM生成文本检测、法医语言学及基于使用的语言研究提供了潜在的启示。

🔬 方法详解

问题定义:本研究旨在解决将LLM输出视为统一语言特征的不足,强调模型间的个体差异。现有方法未能充分识别和分析这些差异,导致对LLM输出的理解局限。

核心思路:论文提出将LLM输出视为个体化特征,借助计算描述符和风格主成分分析,揭示不同模型的独特语言特征及其演变。通过对比不同时间生成的文本,展示语言风格的变化。

技术框架:研究分为数据收集、特征提取和分析三个主要阶段。首先,收集2024年和2026年生成的文本数据;其次,利用计算描述符提取语言特征;最后,通过主成分分析比较不同模型的语言风格。

关键创新:最重要的创新在于提出了将LLM输出视为个体化特征的框架,强调模型特定的语言签名。这一视角与传统的统一AI语言分析方法本质上不同,提供了更深入的理解。

关键设计:在实验中,使用了多种计算描述符来量化语言特征,并采用了主成分分析来识别风格变化。收缩频率的计算为分析提供了具体的量化指标,展示了模型间的显著差异。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,2024年和2026年生成的文本在语言风格上存在显著差异,收缩频率在同一模型群体中变化范围从1200到30000次每百万字,显示出模型特定的语言特征和演变趋势。

🎯 应用场景

该研究的潜在应用领域包括语言学研究、文本生成模型的评估、法医语言学以及语言变异与变化的研究。通过识别和分析LLM输出的个体化特征,研究者可以更好地理解语言的演变和使用模式,进而推动相关领域的发展。

📄 摘要(原文)

While large language model outputs are frequently analysed as a collective super variety termed "AI language," this chapter argues that this perspective coexists with distinct, model-specific linguistic signatures akin to human idiolects. We analyse two datasets of LLM-generated texts on societal topics: a 2024 corpus of six models (Improta et al. 2024) and a newly generated 2026 corpus using the same prompts featuring six contemporary models. Our findings, utilising computational descriptors and stylometric principal component analysis reveal a generational shift between the style of the 2024 and 2026 cohorts, while demonstrating that each individual model maintains a unique linguistic profile. This multi-layered interplay is illustrated by contraction frequencies, which vary from over 1,200 to over 30,000 per million words within the same cohort of models (2026). Ultimately, we conclude that treating LLM output as idiolectal in nature provides a valuable framework with potential implications for research on variation and change, LLM-generated text detection, forensic linguistics and usage-based approaches to language.