Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
作者: Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen
分类: cs.CL, cs.AI
发布日期: 2026-09-03
备注: Accepted to Findings of EMNLP 2026
💡 一句话要点
提出辅助视角以提升大型语言模型的知识获取能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 知识获取 辅助视角 预训练 实验研究 自然语言处理 数据多样性
📋 核心要点
- 现有对大型语言模型知识获取的理解存在空白,特别是在预训练阶段的知识获取机制尚不明确。
- 论文提出通过引入辅助视角来改善知识获取,认为知识的重述形式在学习过程中起到重要作用。
- 实验结果表明,文档重复与辅助视角的结合能显著提升学习效果,尤其是在较小批量的情况下,且与教师模型的强度无关。
📝 摘要(中文)
在大型语言模型(LLMs)预训练过程中,知识获取的机制仍不完全清楚。本文提出辅助视角,即知识的重述形式,有助于学习。通过设计控制实验,我们确认重复对于知识获取是必要的,并指出在较小批量时,释义有助于学习。此外,在固定的标记预算下,将文档重复的标记分配给辅助视角能改善学习效果,甚至在事实回忆中也表现出反直觉的提升。我们还发现,辅助视角的有效性与生成它们的教师模型的强度无关,并识别出在知识缺口存在时,有助于学习的知识形式,包括上下文知识和基础知识。最后,我们探讨了这些效应如何通过层级偏差和压缩机制表现出来。我们的研究表明,辅助知识表示是预训练成功的关键因素,并为数据多样性的重要性提供了合理解释。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在预训练过程中知识获取的机制不明确的问题,现有方法未能充分利用知识的重述形式。
核心思路:论文提出辅助视角作为知识的重述形式,通过控制实验验证其在学习过程中的积极作用,尤其是在知识获取的效率上。
技术框架:研究设计了多个实验,首先确认重复的重要性,然后在固定标记预算下测试文档重复与辅助视角的分配,最后分析这些因素如何通过层级偏差和压缩机制影响学习效果。
关键创新:最重要的创新在于识别出辅助视角在知识获取中的关键作用,尤其是在知识缺口存在时,提供了新的视角来理解预训练的成功因素。
关键设计:实验中使用了不同的批量大小和标记预算设置,重点考察了文档重复和辅助视角的分配策略,确保了实验的可控性和结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在较小批量的情况下,辅助视角的引入使得知识获取效率显著提升,尤其是在事实回忆任务中表现出反直觉的改进。此外,文档重复与辅助视角的结合在固定标记预算下也取得了显著的学习效果提升,验证了辅助视角的重要性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、知识图谱构建和智能问答系统等。通过优化大型语言模型的预训练过程,能够提升模型在实际应用中的表现,尤其是在处理复杂知识任务时。未来,这一研究可能推动更高效的模型训练方法和更智能的AI系统发展。
📄 摘要(原文)
Gaps remain in our understanding of how large language models (LLMs) acquire knowledge during pre-training. We posit that auxiliary views, reformulations of knowledge, are causally helpful for learning. We design controlled experiments to isolate this. First, we confirm that repetition is necessary for acquisition and clarify that paraphrasing helps only at smaller batch sizes. Second, holding the token budget fixed, allocating tokens from document repetition to auxiliary views improves learning, counterintuitively, even for factual recall. Third, the effectiveness of auxiliary views is not contingent on the strength of the teacher model that generates them. Fourth, we identify forms of knowledge, contextual and foundational, that aid learning in the presence of prior knowledge gaps. Finally, we examine how these effects manifest mechanistically via layer-wise biases and compression. Together, our findings suggest that auxiliary representations of knowledge, which arise naturally in large pre-training corpora, are a key factor in the success of pre-training and offer a plausible explanation for why data diversity matters.