已验证65% 置信事实精确时间
强化学习中的智能体不依赖标注数据,而是通过与环境的持续交互,依据奖励信号不断调整策略
3
来源数
65%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/511260API
curl https://kongchang.com/api/v1/knowledge/claims/511260MCP
get_claim(id=511260)https://kongchang.com/claim/511260curl https://kongchang.com/api/v1/knowledge/claims/511260get_claim(id=511260)