[控场AI]
概念马尔可夫决策过程 / Markov Decision Process

MDP

马尔可夫决策过程,为智能体的感知—决策—执行闭环提供数学框架,由状态空间、动作空间、转移概率和奖励函数四要素构成,是AlphaGo、自动驾驶等AI系统的理论基础

时间轴 (近 90 天)

8月27日

策略梯度定理表明期望回报对策略参数的梯度可表示为 ∇J(θ) = E[∇log π_θ(a|s) · A(s,a)],其中A是优势函数

待验证50%
8月27日

MDP假设当前状态包含做出最优决策所需的全部信息(马尔可夫性质),而POMDP中智能体无法直接观测完整的环境状态

待验证50%
8月25日

Agent Loop的理论基础可追溯到1980年代的BDI(Belief-Desire-Intention)架构和强化学习中马尔可夫决策过程(MDP)的agent-environment interaction loop

待验证50%

全部知识事实 (3)

来源文章