待验证50% 置信事实精确时间
在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差
1
来源数
50%
置信度
长期有效
时效性
2026/10/4
首次发现
来源
涉及实体
相关事实
待验证PPO等主流RL算法依赖rollout阶段采集的log概率来计算重要性采样比率,若推理与训练引擎的log-prob存在系统性偏差会导致策略梯度方差增大甚至训练发散75% 相似已验证PPO通过引入裁剪目标函数将新旧策略概率比值限制在[1-ε, 1+ε]区间,替代TRPO的KL散度约束,简化了实现复杂度67% 相似待验证GRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度67% 相似待验证PPO 算法需要计算旧策略概率与新策略概率的比值(importance ratio),两套引擎的分歧会污染该比值66% 相似待验证高准确率的前沿模型评审之间的错误依赖性更强,即使这些评审来自不同的服务商62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/972290API
curl https://kongchang.com/api/v1/knowledge/claims/972290MCP
get_claim(id=972290)