概念Adam with Weight Decay / 解耦权重衰减Adam
AdamW
Adam优化器的改进版本,通过将权重衰减与梯度更新解耦,避免了L2正则化在自适应优化器中的不当交互,是现代大模型训练的常用优化器
时间轴 (近 90 天)
9月12日
该工作的权重衰减简化思路与AdamW中解耦权重衰减的思路有相通之处
待验证50%
9月12日
在 NanoGPT Speedrun 中,Muon 通常只用于隐藏层的矩阵权重,而嵌入层和输出层仍保留 AdamW
待验证50%
9月9日
解码器和表格使用AdamW优化器(学习率1×10⁻⁵),循环权重使用Muon优化器(学习率0.005,动量0.95)
待验证50%
全部知识事实 (6)
待验证
DeepSeek V4采用MUON优化器替代AdamW进行训练
85%待验证Decoupled DiLoCo的外部优化器通常使用Nesterov动量SGD,内部优化器通常为AdamW
85%待验证MUON优化器替代了沿用多年的AdamW优化器,通过引入矩阵正交化步骤使训练曲线更加平滑
80%待验证该工作的权重衰减简化思路与AdamW中解耦权重衰减的思路有相通之处
50%待验证在 NanoGPT Speedrun 中,Muon 通常只用于隐藏层的矩阵权重,而嵌入层和输出层仍保留 AdamW
50%待验证解码器和表格使用AdamW优化器(学习率1×10⁻⁵),循环权重使用Muon优化器(学习率0.005,动量0.95)
50%