概念Deep Deterministic Policy Gradient
DDPG
深度确定性策略梯度算法,最早将深度神经网络引入确定性策略梯度方法,适用于连续动作空间的强化学习任务
时间轴 (近 90 天)
9月24日
Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO
待验证50%
9月24日
TD3 在 DDPG 基础上通过双 Q 网络和延迟策略更新缓解了过估计问题
待验证50%
深度确定性策略梯度算法,最早将深度神经网络引入确定性策略梯度方法,适用于连续动作空间的强化学习任务
Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO
TD3 在 DDPG 基础上通过双 Q 网络和延迟策略更新缓解了过估计问题