ConceptBellman Equation / 贝尔曼最优方程
贝尔曼方程
动态规划的核心方程,描述最优价值函数的递归结构,是强化学习算法设计的理论基础,由Richard Bellman提出
Timeline (last 90 days)
Oct 7
递归熵风险度量在每个时间步嵌套应用风险算子,满足时间一致性,因此可以直接与贝尔曼方程结合
Unverified50%
Aug 27
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系
Unverified50%
动态规划的核心方程,描述最优价值函数的递归结构,是强化学习算法设计的理论基础,由Richard Bellman提出
递归熵风险度量在每个时间步嵌套应用风险算子,满足时间一致性,因此可以直接与贝尔曼方程结合
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系