[KongchangAI]
Unverified50% confidenceFactExact time

基于策略梯度的算法如PPO和GRPO能够处理离散与连续混合的动作空间

1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/542164
API
curl https://kongchang.com/api/v1/knowledge/claims/542164
MCP
get_claim(id=542164)