Grokking的相变结构:量化记忆到泛化的转变规律

首项定量研究揭示Grokking泛化转变的幂律标度律,数据复杂度是最关键驱动因素。
这篇arXiv论文通过扫描384种超参数配置,首次为神经网络「grokking」现象(训练记忆后延迟出现的泛化突变)建立了可量化的预测框架。核心发现是泛化起始时间满足幂律标度关系,其中数据复杂度的指数(-2.04)远超模型宽度(-0.27),意味着增加数据比扩大模型更能有效加速泛化转变。研究还在权重衰减 λ≳1.0 处识别出一条尖锐相边界,将超参数空间分为grokking发生与不发生两个区域,并观察到转变过程中权重范数单调压缩,印证了隐式正则化驱动网络选择低复杂度解的理论。这项工作将grokking从定性观察推进到可预测、可干预的定量阶段,为理解过参数化网络的泛化机制提供了新基础。
神经网络在训练超过记忆阶段后,往往会经历一个延迟的泛化转变,这一现象被称为「grokking」(顿悟)。过去的研究主要聚焦于解释这种转变为什么会发生,但对于它究竟在何时发生——即在超参数空间中的定量结构——却始终缺乏系统刻画。一篇最新的arXiv论文(arXiv:2609.10657v1)通过大规模实验,首次为这一问题提供了可量化的答案。

什么是Grokking现象
Grokking指的是一种反直觉的训练动态:模型在训练集上早已达到近乎完美的拟合(即完成记忆),但测试集性能却长时间停留在随机水平,直到经过大量额外训练步数后,泛化能力才突然「觉醒」并迅速提升。
这一现象最初在模块化算术(modular arithmetic)任务上被广泛观察到,因为这类任务结构清晰、可控性强,便于研究者剥离干扰因素。它挑战了传统机器学习中「过拟合即泛化失败」的直觉,也成为理解过参数化网络学习机制的重要窗口。
研究者此前已在理论层面取得进展,比如将grokking归因于隐式正则化(implicit regularization)驱动网络最终选择低复杂度解。但理论解释无法直接回答工程师最关心的问题:在给定的超参数配置下,泛化转变大概会在什么时候发生?能否预测和控制?
模块化算术任务的典型形式是:给定模数 $p$(通常取质数,如97或113),让模型学习形如 $(a + b) \mod p$ 的运算。输入是两个整数的独热编码(one-hot encoding),输出是运算结果的类别标签。这类任务看似简单,却具有非平凡的代数结构——模型若要真正泛化,需要隐式地发现离散傅里叶变换等周期性表示,而非死记每对输入的答案。正因如此,它成为研究grokking的标准基准:记忆路径与泛化路径之间存在明显区分,研究者可以精确追踪模型在何时从「查表」策略切换到「规律提取」策略。
幂律标度关系:数据复杂度是主导因素
这项研究的核心贡献,是在两层隐藏层MLP上、针对模块化算术任务,系统扫描了384种超参数配置,并拟合出泛化起始时间的幂律标度关系:
$$T_{\mathrm{grok}} \propto H^{-0.27}, D^{-2.04}, \eta^{-0.50}, \lambda^{-0.64}$$
其中 $H$ 为模型宽度(容量),$D$ 为数据复杂度,$\eta$ 为学习率,$\lambda$ 为权重衰减。该拟合的决定系数 $R^2 = 0.732$,加入交互项后提升至 $0.821$,说明这套标度律具有相当的解释力。
最值得关注的是各指数之间的等级关系。数据复杂度的指数高达 $-2.04$,远大于模型容量的 $-0.27$。这意味着:数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速。换句话说,决定grokking转变时机的主导因素并非模型有多大,而是数据有多丰富。
这一结论对实践具有直接指导意义。在面对延迟泛化问题时,盲目堆叠模型参数的收益远不如增加高质量数据来得显著——这与近年来「数据质量优先」的行业共识形成了理论呼应。
幂律标度关系(power-law scaling)在物理学和复杂系统研究中广泛出现,形如 $y \propto x^\alpha$ 的关系意味着变量之间存在尺度不变性。在机器学习语境下,OpenAI等机构的「神经网络扩展定律」(Neural Scaling Laws)研究已表明,模型损失与参数量、数据量、计算量之间均呈幂律关系。本文将这一分析框架迁移到grokking的时间维度,拟合的不是最终性能,而是泛化转变的发生时刻。各超参数指数的绝对值大小直接量化了每个因素对加速或延迟转变的贡献,指数越大(绝对值),该变量的影响越显著——这正是数据复杂度指数 $-2.04$ 远超模型宽度指数 $-0.27$ 这一对比具有核心意义的原因。
权重衰减附近的尖锐相边界
除了标度律,研究还揭示了一个清晰的相边界(phase boundary):当权重衰减 $\lambda \gtrsim 1.0$ 时,系统会从「不发生grokking」的区域跨越到「发生grokking」的区域。这条边界相当尖锐,类似物理学中的相变,配置的微小变化可能导致训练行为的质变。
同时,研究观察到在转变过程中,权重范数(weight norm)呈现单调压缩的轨迹。这一现象与「隐式正则化选择低复杂度解」的理论解释高度一致:随着训练推进,网络逐步被推向更简洁、泛化能力更强的解空间,而权重范数的持续收缩正是这一过程的可观测信号。
将权重衰减视为控制相变的「旋钮」,为工程实践提供了一个可操作的抓手。通过调节 $\lambda$,研究者理论上可以主动触发或抑制grokking,从而更精确地管理过参数化网络的训练轨迹。
物理学中的相变(phase transition)描述系统在某一控制参数跨越临界值时发生的宏观性质突变,例如水在0°C时从液态变为固态。将这一概念引入机器学习,意味着训练动态存在截然不同的「相」——在本文中即「grokking发生」与「grokking不发生」两种定性不同的行为区域。权重衰减 $\lambda$ 在此充当控制参数(control parameter),当其超过临界值 $\lambda \gtrsim 1.0$ 时,系统从一种相跨入另一种相。这种相变视角的价值在于:它预示边界处存在临界现象(critical phenomena),模型行为对参数扰动极度敏感,这既解释了为何grokking长期难以复现,也为系统性调控提供了明确的操作目标。
对理解过参数化网络的意义
这项工作把一个长期停留在「定性观察」层面的现象,推进到了「定量预测」的阶段。它不再只是解释grokking为何存在,而是给出了一套可以估算转变时机、并通过超参数进行干预的框架。
从更宏观的视角看,grokking研究关乎一个根本问题:过参数化的神经网络究竟如何从死记硬背走向真正理解。本文提供的标度律与相结构,为回答这一问题提供了新的定量基础,也为未来在更复杂任务和更大模型上验证这些规律奠定了起点。
补充一点,当前实验局限于两层MLP和模块化算术这一相对简化的设定,标度律能否推广到大规模Transformer或真实世界任务,仍有待进一步检验。但作为一项系统性的定量刻画,它无疑为理解深度学习的泛化机制提供了扎实的一块拼图。


