Verified65% confidenceFactExact time
GRPO通过对同一问题采样一组输出以组内平均奖励作为基线,消除了对独立critic网络的依赖,将显存需求从PPO的约4倍压缩至约2倍
3
Sources
65%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献67% similarUnverified每个中间推理token与输出token消耗等量的GPU算力,Extra High档位单次请求FLOPs可能是普通生成模式的数十倍64% similarVerified连续批处理在每个解码步骤后立即移出已完成序列并插入新请求,将GPU利用率从传统方案的30-50%提升至80%以上59% similarUnverified传统自回归生成每次只能产生一个token,需要完整的前向传播,导致GPU利用率低下,计算单元实际闲置率可达80%以上58% similarUnverified为每个团队单独部署独立GPU集群会导致利用率低下、空闲算力浪费和运维成本成倍增加57% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/542331API
curl https://kongchang.com/api/v1/knowledge/claims/542331MCP
get_claim(id=542331)