强化学习领域奠基者之一,与Andrew Barto合著《Reinforcement Learning: An Introduction》,与John Carmack共同创立Keen Technologies,2024年图灵奖得主
Dyna架构由强化学习先驱Richard Sutton提出
苦涩的教训的核心论点是:依赖人类知识、领域先验和手工规则的方法短期表现出色,但长期总被单纯依靠算力和数据的通用方法所超越
Dyna-Q由强化学习先驱Richard Sutton于1991年提出,是一种将模型学习与无模型学习相结合的方法
《Reinforcement Learning: An Introduction》由Richard Sutton和Andrew Barto合著,第二版于2018年更新,全书可免费在线阅读
时序差分(TD)学习由 Richard Sutton 在1988年正式提出,结合了蒙特卡洛方法和动态规划的优点
Richard Sutton与Andrew Barto合著了《Reinforcement Learning: An Introduction》,系统性地奠定了强化学习领域的理论框架
Richard Sutton是强化学习的创始人之一,于2019年发表了短文《The Bitter Lesson》。
Richard Sutton是强化学习的创始人之一,于2019年发表了短文《The Bitter Lesson》。
80%VerifiedRichard Sutton与Andrew Barto合著了《Reinforcement Learning: An Introduction》,系统性地奠定了强化学习领域的理论框架
65%UnverifiedDyna架构由强化学习先驱Richard Sutton提出
50%Unverified苦涩的教训的核心论点是:依赖人类知识、领域先验和手工规则的方法短期表现出色,但长期总被单纯依靠算力和数据的通用方法所超越
50%UnverifiedDyna-Q由强化学习先驱Richard Sutton于1991年提出,是一种将模型学习与无模型学习相结合的方法
50%Unverified《Reinforcement Learning: An Introduction》由Richard Sutton和Andrew Barto合著,第二版于2018年更新,全书可免费在线阅读
50%Unverified时序差分(TD)学习由 Richard Sutton 在1988年正式提出,结合了蒙特卡洛方法和动态规划的优点
50%