马尔可夫决策过程,为智能体的感知—决策—执行闭环提供数学框架,由状态空间、动作空间、转移概率和奖励函数四要素构成,是AlphaGo、自动驾驶等AI系统的理论基础
Agent Loop的理论基础可追溯到1980年代的BDI(Belief-Desire-Intention)架构和强化学习中马尔可夫决策过程(MDP)的agent-environment interaction loop