[控场AI]
已验证65% 置信事实精确时间

PPO(近端策略优化)通过限制每次参数更新的幅度,在学习效率与训练稳定性之间取得平衡

3
来源数
65%
置信度
长期有效
时效性
2026/7/15
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/518283
API
curl https://kongchang.com/api/v1/knowledge/claims/518283
MCP
get_claim(id=518283)