[控场AI]
待验证50% 置信事实精确时间

无模型强化学习方法(如Q-Learning、PPO)直接从与环境的交互中学习策略或价值函数,不显式建模环境的动态规律

1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现

来源

涉及实体

引用此条事实

Stable URI
https://kongchang.com/claim/902769
API
curl https://kongchang.com/api/v1/knowledge/claims/902769
MCP
get_claim(id=902769)