[控场AI]
概念Bellman Equation / 贝尔曼最优方程

贝尔曼方程

动态规划的核心方程,描述最优价值函数的递归结构,是强化学习算法设计的理论基础,由Richard Bellman提出

时间轴 (近 90 天)

10月7日

递归熵风险度量在每个时间步嵌套应用风险算子,满足时间一致性,因此可以直接与贝尔曼方程结合

待验证50%
8月27日

贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系

待验证50%

全部知识事实 (2)

来源文章