Unverified50% confidenceFactExact time
无模型强化学习方法(如Q-Learning、PPO)直接从与环境的交互中学习策略或价值函数,不显式建模环境的动态规律
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Cite This Claim
Stable URI
https://kongchang.com/claim/902769API
curl https://kongchang.com/api/v1/knowledge/claims/902769MCP
get_claim(id=902769)