[控场AI]
概念Deep Deterministic Policy Gradient

DDPG

深度确定性策略梯度算法,最早将深度神经网络引入确定性策略梯度方法,适用于连续动作空间的强化学习任务

时间轴 (近 90 天)

9月24日

Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO

待验证50%
9月24日

TD3 在 DDPG 基础上通过双 Q 网络和延迟策略更新缓解了过估计问题

待验证50%

全部知识事实 (2)

来源文章