Biologically Inspired Mechanisms for Facilitating Grokking in Multilayer Perceptrons

📄 arXiv: 2608.28184v1 📥 PDF

作者: Florin Leon

分类: cs.LG

发布日期: 2026-08-28

备注: 51 pages, 9 figures


💡 一句话要点

提出生物启发机制以促进多层感知器的Grokking过程

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生物启发机制 多层感知器 Grokking 神经元活动 泛化能力 结构可塑性 激活去相关 稳态调节

📋 核心要点

  1. 核心问题:现有的多层感知器在从记忆到泛化的转变过程中,缺乏有效的机制来促进内部表征的重组。
  2. 方法要点:本文通过引入多种生物启发机制,调节隐藏层的神经元活动和连接性,以促进Grokking过程。
  3. 实验或效果:实验结果显示,稳态机制和结构稀疏化对泛化效果有显著提升,稳态机制效果最为明显。

📝 摘要(中文)

Grokking是从记忆到泛化的延迟转变,通常伴随着内部表征的重大重组。本文研究了生物启发机制是否能够通过调节隐藏层计算,促进这一转变。我们在多层感知器中引入了输入门控、结构可塑性、增益调制、阈值调制、稳态、侧抑制和激活去相关等机制,并在稀疏奇偶性和噪声XOR分类这两个基准上进行了系统性消融实验。结果表明,这些机制对泛化的贡献不均,稳态机制提供了最强且最一致的益处,而结构稀疏化则是第二大机制。其余机制的效果较小或不一致。这些发现支持了显式调节神经元利用率和有效连接性可以改善可泛化内部计算的原则。

🔬 方法详解

问题定义:本文旨在解决多层感知器在学习过程中,从简单的记忆到复杂的泛化能力转变时的不足,现有方法往往无法有效促进内部表征的重组。

核心思路:通过引入生物启发的机制,如输入门控和稳态调节,来调节神经元的活动和连接性,从而促进Grokking过程的发生。这样的设计旨在模拟生物神经系统的自适应特性,以提高模型的泛化能力。

技术框架:整体架构包括多层感知器的基本结构,结合输入门控、结构可塑性、增益调制、阈值调制、稳态、侧抑制和激活去相关等模块。通过系统性消融实验,评估各机制对泛化能力的贡献。

关键创新:最重要的创新在于将多种生物启发机制系统性地整合到多层感知器中,尤其是稳态机制的引入,显著提升了模型的泛化能力,与传统方法相比,提供了更为有效的调节手段。

关键设计:在参数设置上,采用了适应性学习率和不同的损失函数,以优化模型的训练过程。网络结构上,增加了输入门控和侧抑制机制,以调节神经元的激活状态和连接强度。实验中使用了稀疏奇偶性和噪声XOR分类作为基准任务。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,稳态机制在泛化能力上提供了最强的支持,提升幅度显著,而结构稀疏化机制则表现为第二大贡献。整体来看,生物启发机制的引入有效改善了模型的内部计算能力,支持了神经元利用率和连接性的显式调节。

🎯 应用场景

该研究的潜在应用领域包括深度学习模型的优化,尤其是在需要高泛化能力的任务中,如自然语言处理和计算机视觉。通过引入生物启发机制,可以加速大规模模型的训练过程,提高其在复杂任务中的表现,具有重要的实际价值和未来影响。

📄 摘要(原文)

Grokking is a delayed transition from memorization to generalization that is often accompanied by substantial reorganization of internal representations. This paper studies whether biologically inspired mechanisms, many of which are not commonly incorporated into artificial neural networks, can actively promote this transition by regulating hidden-layer computation at the levels of neuronal activity, response, and effective connectivity. We augment a multilayer perceptron with input gating, structural plasticity, gain modulation, threshold modulation, homeostasis, lateral inhibition, and activation decorrelation, and evaluate these mechanisms through systematic ablations on two established grokking benchmarks: sparse parity and noisy XOR classification. The results show that the mechanisms contribute unequally to generalization. Homeostasis provides the strongest and most consistent benefit, while structural sparsification emerges as the second major mechanism. The remaining biologically inspired mechanisms have smaller or less consistent effects in the present experiments. For both problems, the results support the common principle that explicit regulation of neuron utilization and effective connectivity can improve the emergence of generalizable internal computation. These findings motivate broader investigation of biologically inspired activity regulation and adaptive sparsification, including in large language models, where they may accelerate the development of generalizable representations and reduce the optimization time required for robust generalization.