Grokking
深度学习中一种反直觉的训练动态现象:模型在训练集上完成记忆后,测试集性能长时间停留在随机水平,经过大量额外训练步数后泛化能力才突然觉醒并迅速提升,最初在模块化算术任务上被广泛观察到
Timeline (last 90 days)
权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking
决定grokking转变时机的主导因素是数据复杂度而非模型容量
研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界
研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹
Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象
Grokking现象最初在模块化算术任务上被广泛观察到
研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减
该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821
数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速
市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统
2 more timeline events
All Facts (12)
权重衰减可视为控制grokking相变的旋钮,通过调节λ理论上可以主动触发或抑制grokking
50%Unverified决定grokking转变时机的主导因素是数据复杂度而非模型容量
50%Unverified研究揭示当权重衰减λ≳1.0时,系统会从不发生grokking的区域跨越到发生grokking的区域,形成尖锐的相边界
50%Unverified研究观察到在grokking转变过程中权重范数呈现单调压缩的轨迹
50%UnverifiedGrokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象
50%UnverifiedGrokking现象最初在模块化算术任务上被广泛观察到
50%Unverified研究拟合出泛化起始时间的幂律标度关系为 T_grok ∝ H^(-0.27) D^(-2.04) η^(-0.50) λ^(-0.64),其中H为模型宽度,D为数据复杂度,η为学习率,λ为权重衰减
50%Unverified该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.821
50%Unverified数据复杂度的指数(-2.04)远大于模型容量的指数(-0.27),意味着数据翻倍能让泛化加速约4倍,而模型宽度翻倍仅带来约1.2倍的加速
50%Unverified市面上成熟的系统设计资源(如《System Design Interview》系列、Grokking等)大多聚焦于传统后端系统
50%Unverified市面上成熟的系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足
50%Unverified经典系统设计资源如《System Design Interview》系列和Grokking大多聚焦传统后端系统,对AI/ML特有挑战覆盖不足
50%