[控场AI]
概念表格型Q-learning / tabular Q-learning

Q-learning

强化学习中最经典的值函数方法之一,由Watkins于1989年提出,核心是维护Q表记录每个状态下执行每个动作的预期累积奖励值,通过贝尔曼方程迭代更新

时间轴 (近 90 天)

9月6日

1989年Chris Watkins提出Q-learning算法,奠定了无模型强化学习的基础

待验证50%
8月30日

DQN的关键在于将卷积神经网络与Q-learning算法结合,让智能体无需手工设计特征即可自主学习策略

待验证50%

全部知识事实 (2)

来源文章