概念马尔可夫决策过程 / Markov Decision Process
MDP
马尔可夫决策过程,为智能体的感知—决策—执行闭环提供数学框架,由状态空间、动作空间、转移概率和奖励函数四要素构成,是AlphaGo、自动驾驶等AI系统的理论基础
时间轴 (近 90 天)
8月27日
策略梯度定理表明期望回报对策略参数的梯度可表示为 ∇J(θ) = E[∇log π_θ(a|s) · A(s,a)],其中A是优势函数
待验证50%
8月27日
MDP假设当前状态包含做出最优决策所需的全部信息(马尔可夫性质),而POMDP中智能体无法直接观测完整的环境状态
待验证50%
8月25日
Agent Loop的理论基础可追溯到1980年代的BDI(Belief-Desire-Intention)架构和强化学习中马尔可夫决策过程(MDP)的agent-environment interaction loop
待验证50%