[KongchangAI]
Unverified50% confidenceFactExact time

PPO通过引入信任域约束防止策略更新过大导致训练崩溃,是目前大模型RL训练中最广泛应用的基础算法之一

1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/542163
API
curl https://kongchang.com/api/v1/knowledge/claims/542163
MCP
get_claim(id=542163)