[KongchangAI]
Unverified50% confidenceFactExact time

Qwen2.5后训练首次在在线阶段使用GRPO,GRPO是DeepSeek团队提出的PPO轻量化变体,去掉独立价值网络,用组内平均奖励作为基线

1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/585439
API
curl https://kongchang.com/api/v1/knowledge/claims/585439
MCP
get_claim(id=585439)