Unverified50% confidenceFactExact time
时序差分(TD)学习由 Richard Sutton 在1988年正式提出,结合了蒙特卡洛方法和动态规划的优点
1
Sources
50%
Confidence
Long-term
Relevance
8/26/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRichard Sutton在1990年提出的Dyna架构首次将基于模型的规划与无模型学习统一67% similarUnverified理查德·萨顿在教材《Reinforcement Learning: An Introduction》中指出塞缪尔的跳棋程序是TD学习思想的最早实践之一,比TD(λ)的正式理论化早了近30年62% similarVerifiedSutton与Barto于1988年出版了《Reinforcement Learning: An Introduction》61% similarUnverifiedRichard Sutton和Andrew Barto在1998年出版的《Reinforcement Learning: An Introduction》系统形式化了RL理论框架56% similarUnverified智能体-环境交互模型由Richard Sutton和Andrew Barto在1990年代的经典教材中系统化55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/805329API
curl https://kongchang.com/api/v1/knowledge/claims/805329MCP
get_claim(id=805329)