待验证50% 置信事实精确时间
时序差分(TD)学习由 Richard Sutton 在1988年正式提出,结合了蒙特卡洛方法和动态规划的优点
1
来源数
50%
置信度
长期有效
时效性
2026/8/26
首次发现
来源
涉及实体
相关事实
待验证Richard Sutton在1990年提出的Dyna架构首次将基于模型的规划与无模型学习统一67% 相似待验证理查德·萨顿在教材《Reinforcement Learning: An Introduction》中指出塞缪尔的跳棋程序是TD学习思想的最早实践之一,比TD(λ)的正式理论化早了近30年62% 相似已验证Sutton与Barto于1988年出版了《Reinforcement Learning: An Introduction》61% 相似待验证Richard Sutton和Andrew Barto在1998年出版的《Reinforcement Learning: An Introduction》系统形式化了RL理论框架56% 相似待验证智能体-环境交互模型由Richard Sutton和Andrew Barto在1990年代的经典教材中系统化55% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/805329API
curl https://kongchang.com/api/v1/knowledge/claims/805329MCP
get_claim(id=805329)