[KongchangAI]
Concept顿悟现象 / 延迟泛化

Grokking

深度学习中一种反直觉的训练动态现象:模型在训练集上完成记忆后,测试集性能长时间停留在随机水平,经过大量额外训练步数后泛化能力才突然觉醒并迅速提升,最初在模块化算术任务上被广泛观察到

Timeline (last 90 days)

Sep 12

权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking

Unverified50%
Sep 12

决定grokking转变时机的主导因素是数据复杂度而非模型容量

Unverified50%
Sep 12

研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界

Unverified50%
Sep 12

研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹

Unverified50%
Sep 12

Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象

Unverified50%
Sep 12

Grokking现象最初在模块化算术任务上被广泛观察到

Unverified50%
Sep 12

研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减

Unverified50%
Sep 12

该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821

Unverified50%
Sep 12

数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速

Unverified50%
Aug 31

市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统

Unverified50%

2 more timeline events

All Facts (12)

Unverified

权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking

50%
Unverified

决定grokking转变时机的主导因素是数据复杂度而非模型容量

50%
Unverified

研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界

50%
Unverified

研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹

50%
Unverified

Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象

50%
Unverified

Grokking现象最初在模块化算术任务上被广泛观察到

50%
Unverified

研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减

50%
Unverified

该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821

50%
Unverified

数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速

50%
Unverified

市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统

50%
Unverified

市面上成熟的系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足

50%
Unverified

经典系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足

50%

Source Articles