[控场AI]
待验证60% 置信事实精确时间

强化学习领域的'智能体-环境'交互框架由Sutton & Barto在1998年的经典著作《Reinforcement Learning: An Introduction》中系统化

2
来源数
60%
置信度
长期有效
时效性
2026/7/11
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/486570
API
curl https://kongchang.com/api/v1/knowledge/claims/486570
MCP
get_claim(id=486570)