[KongchangAI]
Concept马尔可夫决策过程 / Markov Decision Process

MDP

马尔可夫决策过程,为智能体的感知—决策—执行闭环提供数学框架,由状态空间、动作空间、转移概率和奖励函数四要素构成,是AlphaGo、自动驾驶等AI系统的理论基础

Timeline (last 90 days)

Aug 25

Agent Loop的理论基础可追溯到1980年代的BDI(Belief-Desire-Intention)架构和强化学习中马尔可夫决策过程(MDP)的agent-environment interaction loop

Unverified50%

All Facts (1)

Source Articles