Canalization Before Generalization: Grokking as a Dynamical Probe

📄 arXiv: 2608.25813v1 📥 PDF

作者: Yiming Lin

分类: cs.LG

发布日期: 2026-08-26

备注: 21 pages, 10 figures


💡 一句话要点

提出Grokking机制以解决过参数化神经网络的泛化问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)

关键词: 过参数化神经网络 泛化能力 Grokking机制 权重衰减 训练优化 模型选择 深度学习

📋 核心要点

  1. 核心问题:现有的过参数化神经网络在训练数据拟合良好的情况下,泛化能力却存在显著差异,难以理解其原因。
  2. 方法要点:论文提出Grokking机制,通过施加权重衰减脉冲,研究训练过程中的泛化选择及其时间效应。
  3. 实验或效果:在三个grokking任务中,发现权重衰减的变化影响泛化时间,形成稳定的剂量排序,且这种效应在可见泛化之前出现。

📝 摘要(中文)

在过参数化神经网络中,许多解决方案能够同样很好地拟合训练数据,但在未见样本上的表现却截然不同。Grokking机制将训练拟合与可见泛化分开,为研究这种选择在训练过程中的发展提供了窗口。通过在这一平台上施加短暂的固定时长的权重衰减脉冲,我们测量了它们如何影响后续的泛化时间。在三个grokking任务中,这些影响在平台早期是无序的,但随后形成了稳定的剂量排序,强权重衰减的增加导致更早的泛化,而强权重衰减的减少则导致更晚的泛化。这种排序在所有三个任务中都在可见泛化之前出现。同时,扰动与基线泛化检查点之间的测试损失障碍趋向于零,而有序的时间效应依然存在。我们称这种日益受限的解决方案选择与持久的剂量排序时间敏感性结合为功能选择的管道化。

🔬 方法详解

问题定义:论文要解决的问题是过参数化神经网络在训练数据上拟合良好但在未见样本上表现不佳的现象。现有方法未能有效解释这种泛化能力的差异,导致对模型选择的理解不足。

核心思路:论文的核心思路是引入Grokking机制,通过施加短暂的权重衰减脉冲,观察其对泛化能力的影响。这种设计旨在揭示训练过程中的选择机制及其时间效应。

技术框架:整体架构包括三个主要阶段:首先,进行训练以拟合数据;其次,施加不同强度的权重衰减脉冲;最后,评估这些脉冲对后续泛化时间的影响。

关键创新:最重要的技术创新点在于提出了“管道化”的概念,强调了在训练过程中逐渐收敛的解决方案选择与时间敏感性之间的关系。这与传统方法的静态选择机制有本质区别。

关键设计:在实验中,设置了不同强度的权重衰减脉冲,并通过对比测试损失来评估其对泛化时间的影响。网络结构和损失函数的选择也经过精心设计,以确保实验结果的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在三个grokking任务中,施加权重衰减脉冲后,泛化时间的变化呈现出稳定的剂量排序。具体而言,强权重衰减的增加使泛化时间提前,而强权重衰减的减少则延后泛化。这一现象在可见泛化之前就已显现,验证了Grokking机制的有效性。

🎯 应用场景

该研究的潜在应用领域包括深度学习模型的训练优化、自动化机器学习以及神经网络的可解释性研究。通过理解Grokking机制,研究人员可以设计出更具泛化能力的模型,提升在真实世界应用中的表现。未来,该研究可能对模型选择和训练策略的制定产生深远影响。

📄 摘要(原文)

For overparameterized neural networks, many solutions can fit the training data equally well while behaving very differently on unseen samples. Grokking separates training fit from visible generalization, providing a window for studying how this selection develops during training. We sweep short, fixed-duration weight-decay (WD) pulses across this plateau and measure how they shift later generalization time. Across three grokking tasks, these shifts are unordered early in the plateau but later form a stable dose ordering, with stronger WD increases leading to earlier generalization and stronger WD decreases leading to later generalization. This ordering emerges before visible generalization in all three tasks. Meanwhile, test-loss barriers between perturbed and baseline generalization checkpoints collapse toward zero while the ordered timing effects persist. We call this combination of increasingly constrained solution selection and persistent dose-ordered timing sensitivity the canalization of function selection.