概念Bellman Equation / 贝尔曼最优方程
贝尔曼方程
动态规划的核心方程,描述最优价值函数的递归结构,是强化学习算法设计的理论基础,由Richard Bellman提出
时间轴 (近 90 天)
10月7日
递归熵风险度量在每个时间步嵌套应用风险算子,满足时间一致性,因此可以直接与贝尔曼方程结合
待验证50%
8月27日
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系
待验证50%
动态规划的核心方程,描述最优价值函数的递归结构,是强化学习算法设计的理论基础,由Richard Bellman提出
递归熵风险度量在每个时间步嵌套应用风险算子,满足时间一致性,因此可以直接与贝尔曼方程结合
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系