Unverified50% confidenceFactExact time
GAE通过引入λ参数在偏差和方差之间折中,λ=1退化为蒙特卡洛估计,λ=0退化为单步TD估计,实践中λ=0.95左右通常能取得良好平衡
1
Sources
50%
Confidence
Long-term
Relevance
8/5/2026
First Seen
Sources
Related Claims
Unverified梯度下降通过迭代公式 θ = θ - α∇J(θ) 更新参数,其中α是学习率,∇J(θ)是损失函数对参数的偏导数向量61% similarUnverified均匀量化引入的误差近似服从均匀分布,其方差为Δ²/12(Δ为量化步长)60% similarUnverifiedFocal Loss在标准交叉熵损失前添加调制因子(1-p_t)^γ,γ通常设为2,使模型聚焦于困难样本60% similarUnverified梯度下降更新规则为 v → v − η∇C,由于 η>0 且 ‖∇C‖²≥0,保证每次更新降低代价 ΔC ≤ 060% similarUnverified优势函数A(s,a) = Q(s,a) - V(s),PPO实际实现中通常使用广义优势估计(GAE),典型设置λ取0.95,γ取0.9959% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/691005API
curl https://kongchang.com/api/v1/knowledge/claims/691005MCP
get_claim(id=691005)