[KongchangAI]
Unverified50% confidenceFactExact time

基于策略梯度的算法(如 PPO)通常包含 Actor 网络 π(s) 和 Critic 网络 V(s) 两个核心网络

1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/493658
API
curl https://kongchang.com/api/v1/knowledge/claims/493658
MCP
get_claim(id=493658)