待验证50% 置信事实精确时间
GAE通过引入λ参数在偏差和方差之间折中,λ=1退化为蒙特卡洛估计,λ=0退化为单步TD估计,实践中λ=0.95左右通常能取得良好平衡
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证梯度下降通过迭代公式 θ = θ - α∇J(θ) 更新参数,其中α是学习率,∇J(θ)是损失函数对参数的偏导数向量61% 相似待验证均匀量化引入的误差近似服从均匀分布,其方差为Δ²/12(Δ为量化步长)60% 相似待验证Focal Loss在标准交叉熵损失前添加调制因子(1-p_t)^γ,γ通常设为2,使模型聚焦于困难样本60% 相似待验证梯度下降更新规则为 v → v − η∇C,由于 η>0 且 ‖∇C‖²≥0,保证每次更新降低代价 ΔC ≤ 060% 相似待验证优势函数A(s,a) = Q(s,a) - V(s),PPO实际实现中通常使用广义优势估计(GAE),典型设置λ取0.95,γ取0.9959% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/691005API
curl https://kongchang.com/api/v1/knowledge/claims/691005MCP
get_claim(id=691005)