[控场AI]
概念顿悟现象 / 延迟泛化

Grokking

深度学习中一种反直觉的训练动态现象:模型在训练集上完成记忆后,测试集性能长时间停留在随机水平,经过大量额外训练步数后泛化能力才突然觉醒并迅速提升,最初在模块化算术任务上被广泛观察到

时间轴 (近 90 天)

9月12日

权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking

待验证50%
9月12日

决定grokking转变时机的主导因素是数据复杂度而非模型容量

待验证50%
9月12日

研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界

待验证50%
9月12日

研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹

待验证50%
9月12日

Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象

待验证50%
9月12日

Grokking现象最初在模块化算术任务上被广泛观察到

待验证50%
9月12日

研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减

待验证50%
9月12日

该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821

待验证50%
9月12日

数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速

待验证50%
8月31日

市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统

待验证50%

还有 2 条时间轴事件

全部知识事实 (12)

待验证

权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking

50%
待验证

决定grokking转变时机的主导因素是数据复杂度而非模型容量

50%
待验证

研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界

50%
待验证

研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹

50%
待验证

Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象

50%
待验证

Grokking现象最初在模块化算术任务上被广泛观察到

50%
待验证

研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减

50%
待验证

该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821

50%
待验证

数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速

50%
待验证

市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统

50%
待验证

市面上成熟的系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足

50%
待验证

经典系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足

50%

来源文章