Unverified50% confidenceFactExact time
在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差
1
Sources
50%
Confidence
Long-term
Relevance
10/4/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedPPO等主流RL算法依赖rollout阶段采集的log概率来计算重要性采样比率,若推理与训练引擎的log-prob存在系统性偏差会导致策略梯度方差增大甚至训练发散75% similarVerifiedPPO通过引入裁剪目标函数将新旧策略概率比值限制在[1-ε, 1+ε]区间,替代TRPO的KL散度约束,简化了实现复杂度67% similarUnverifiedGRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度67% similarUnverifiedPPO 算法需要计算旧策略概率与新策略概率的比值(importance ratio),两套引擎的分歧会污染该比值66% similarUnverified高准确率的前沿模型评审之间的错误依赖性更强,即使这些评审来自不同的服务商62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/972290API
curl https://kongchang.com/api/v1/knowledge/claims/972290MCP
get_claim(id=972290)