A Graph Signal Processing Perspective on Numerical Sequence Representations in LLM In-Context Learning
作者: Jiajun Bao, Zihao Qi, Toni J. B. Liu, Gurbir Arora, Raphaël Sarfati, Nicolas Boullé, Christopher J. Earls
分类: cs.LG, cs.AI, eess.SP
发布日期: 2026-08-04
💡 一句话要点
提出图信号处理视角以解析LLM中的数字序列表示
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 图信号处理 大型语言模型 上下文学习 数字推理 注意力机制 隐藏状态信号 输入复杂性
📋 核心要点
- 现有方法主要通过输出级评估来分析LLM的数字推理能力,但对其内部表示的组织方式了解不足。
- 本文采用图信号处理的视角,分析注意力机制如何在标记上构建加权图,并探讨隐藏状态信号的特征。
- 研究发现,随着上下文长度增加,输入的动态复杂性使得表示变得更加清晰,简单输入与复杂输入在图结构和信号特征上存在显著差异。
📝 摘要(中文)
预训练的大型语言模型(LLMs)在上下文学习(ICL)中展现了对序列数字推理的能力。以往研究主要通过输出级评估来识别和表征这种数字推理,但LLM内部如何组织数字信息仍不甚明了。本文采用图信号处理的视角,探讨注意力机制如何在标记上诱导加权图,同时标记的隐藏状态定义了节点上的信号。定量图谱诊断和定性标记图可视化表明,随着上下文长度的增加,表示在输入动态复杂性上变得更加清晰区分。简单输入产生更强的全局连接性,而复杂输入则导致更局部的图和更广泛的频谱支持。
🔬 方法详解
问题定义:本文旨在解决如何理解LLM内部数字信息组织的问题。现有方法主要依赖输出级评估,未能深入探讨内部表示的结构和特征。
核心思路:通过图信号处理的视角,分析注意力机制在标记上构建的加权图,并利用隐藏状态信号的特征来理解数字推理的内部机制。
技术框架:整体架构包括输入序列的表示、注意力机制构建的加权图、以及对图谱特征的定量和定性分析。主要模块包括图谱构建、信号分析和可视化。
关键创新:本文的创新在于将图信号处理引入LLM的研究,揭示了上下文长度与输入复杂性对表示的影响,提供了新的分析工具和视角。
关键设计:在参数设置上,关注图的加权机制和隐藏状态信号的频谱特征,采用定量图谱诊断和定性可视化方法来分析不同输入的影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,随着上下文长度的增加,简单输入的注意力诱导图表现出更强的全局连接性,而复杂输入则导致更局部的图结构。具体而言,简单输入的隐藏状态信号更集中,而复杂输入的信号则具有更广泛的频谱支持,显示出更高的频率能量。
🎯 应用场景
该研究为理解大型语言模型在数字推理中的内部机制提供了新的视角,具有广泛的应用潜力。未来可在教育、金融数据分析等领域中,利用该方法优化模型性能,提升数字推理的准确性和效率。
📄 摘要(原文)
Pretrained large language models (LLMs) have demonstrated in-context learning (ICL) capabilities for numerical inference over sequences serialized as text. Prior work has identified and characterized this form of numerical inference primarily through output-level evaluations such as prediction error. However, how numerical information is organized within LLM representations remains much less understood. To study this internal organization, we adopt a graph signal processing perspective in which attention induces a weighted graph over tokens, while token hidden states define signals on its nodes. Quantitative graph-spectral diagnostics and qualitative token-graph visualizations reveal that representations become more clearly differentiated by input dynamical complexity as context length increases. Simpler inputs produce attention-induced token graphs with stronger global connectivity and smoother, spectrally concentrated hidden-state signals, whereas more complex inputs produce more localized graphs and hidden-state signals with broader spectral support and greater high-frequency energy. Together, these findings point to systematic, context-dependent internal signatures associated with numerical ICL that are conserved across model families.