概念表格型Q-learning / tabular Q-learning
Q-learning
强化学习中最经典的值函数方法之一,由Watkins于1989年提出,核心是维护Q表记录每个状态下执行每个动作的预期累积奖励值,通过贝尔曼方程迭代更新
时间轴 (近 90 天)
9月6日
1989年Chris Watkins提出Q-learning算法,奠定了无模型强化学习的基础
待验证50%
8月30日
DQN的关键在于将卷积神经网络与Q-learning算法结合,让智能体无需手工设计特征即可自主学习策略
待验证50%