[控场AI]
概念Adam with Weight Decay / 解耦权重衰减Adam

AdamW

Adam优化器的改进版本,通过将权重衰减与梯度更新解耦,避免了L2正则化在自适应优化器中的不当交互,是现代大模型训练的常用优化器

时间轴 (近 90 天)

9月12日

该工作的权重衰减简化思路与AdamW中解耦权重衰减的思路有相通之处

待验证50%
9月12日

在 NanoGPT Speedrun 中,Muon 通常只用于隐藏层的矩阵权重,而嵌入层和输出层仍保留 AdamW

待验证50%
9月9日

解码器和表格使用AdamW优化器(学习率1×10⁻⁵),循环权重使用Muon优化器(学习率0.005,动量0.95)

待验证50%

全部知识事实 (6)

来源文章