Unverified50% confidenceTradeoffExact time
当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献
1
Sources
50%
Confidence
Long-term
Relevance
10/7/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedGRPO通过对同一问题采样一组输出以组内平均奖励作为基线,消除了对独立critic网络的依赖,将显存需求从PPO的约4倍压缩至约2倍67% similarUnverified对比学习中的推远操作只要求负样本相似度低于正样本,并不要求达到-1的极端值67% similarUnverified若一道难题在采样中全部失败(pass@k约为0),奖励方差为零,梯度信号几乎消失,参数更新量趋近于零66% similarUnverified当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向63% similarUnverified该模型的输出token为零,因为它只返回概率而不生成文本62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/982892API
curl https://kongchang.com/api/v1/knowledge/claims/982892MCP
get_claim(id=982892)