Concept马尔可夫决策过程 / Markov Decision Process
MDP
马尔可夫决策过程,为智能体的感知—决策—执行闭环提供数学框架,由状态空间、动作空间、转移概率和奖励函数四要素构成,是AlphaGo、自动驾驶等AI系统的理论基础
Timeline (last 90 days)
Aug 25
Agent Loop的理论基础可追溯到1980年代的BDI(Belief-Desire-Intention)架构和强化学习中马尔可夫决策过程(MDP)的agent-environment interaction loop
Unverified50%