Unverified90% confidenceFactTime unknown
AdaGrad通过累积历史梯度平方实现自适应,但会导致学习率单调递减直至停止更新
1
Sources
90%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Adam优化器深度拆解:一文搞懂自适应矩估计原理
bilibili深度学习自习室
Related Entities
Related Claims
Verified艾宾浩斯遗忘曲线揭示记忆强度随时间呈指数级衰减,通过间隔重复可延缓这一过程67% similarUnverified梯度下降衍生出批量梯度下降、随机梯度下降和小批量梯度下降三种主要变体,Adam优化器是在动量与自适应学习率基础上的综合改进65% similarUnverified梯度下降的收敛条件与学习率和损失函数的Lipschitz常数的关系有关65% similarUnverified余弦退火让学习率按余弦曲线平滑下降至接近零并周期性重启,被SGDR算法正式化64% similarUnverified梯度下降的权重更新规则为 w = w - lr * gradient,其中lr是学习率64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/7718API
curl https://kongchang.com/api/v1/knowledge/claims/7718MCP
get_claim(id=7718)