Unverified50% confidenceFactExact time
梯度下降的权重更新规则为 w = w - lr * gradient,其中lr是学习率
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
Unverified梯度下降的收敛条件与学习率和损失函数的Lipschitz常数的关系有关75% similarUnverified梯度下降衍生出批量梯度下降、随机梯度下降和小批量梯度下降三种主要变体,Adam优化器是在动量与自适应学习率基础上的综合改进69% similarUnverified批量梯度下降使用全部训练数据计算梯度,随机梯度下降每次只用一个样本,小批量梯度下降在两者之间取得平衡68% similarVerified梯度下降通过沿着损失函数梯度的反方向迭代调整权重使预测误差逐步收敛67% similarUnverifiedAdaGrad通过累积历史梯度平方实现自适应,但会导致学习率单调递减直至停止更新64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/741877API
curl https://kongchang.com/api/v1/knowledge/claims/741877MCP
get_claim(id=741877)