[控场AI]
待验证50% 置信事实精确时间

GRPO用组内基线替代传统价值函数估计,通过组内标准化A_i = (R_i - mean(R)) / std(R)计算优势值,省去单独训练价值网络的开销

1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/690917
API
curl https://kongchang.com/api/v1/knowledge/claims/690917
MCP
get_claim(id=690917)