Unverified50% confidenceFactExact time
GRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedCISPO(Clipped Importance Sampling Policy Optimization)与 PPO 同源,通过重要性采样比值的裁剪约束策略更新幅度70% similarUnverifiedSAC 是 Off-Policy 算法,通过最大化策略熵鼓励探索,样本效率通常优于 PPO,但在超参数敏感度和训练稳定性方面稍逊64% similarVerifiedPPO通过引入裁剪目标函数将新旧策略概率比值限制在[1-ε, 1+ε]区间,替代TRPO的KL散度约束,简化了实现复杂度63% similarUnverifiedTRPO通过约束策略更新的KL散度来保证单调改进,但需要计算二阶导数(Fisher信息矩阵),实现复杂度高于PPO62% similarUnverifiedTRPO使用共轭梯度法和线搜索求解约束优化问题,涉及Fisher信息矩阵,是二阶方法,计算开销高于普通梯度下降62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/910344API
curl https://kongchang.com/api/v1/knowledge/claims/910344MCP
get_claim(id=910344)