PPO
PPO(Proximal Policy Optimization,近端策略优化)是一种基于策略梯度的强化学习算法,通过引入截断的概率比率约束,限制每次参数更新的幅度,从而在训练稳定性与样本效率之间取得平衡。PPO实现简单、超参数较少,被广泛应用于机器人控制、游戏智能体训练以及大语言模型的人类反馈强化学习(RLHF)等场景。
Core Facts
Timeline (last 90 days)
PPO 算法需要计算旧策略概率与新策略概率的比值(importance ratio),两套引擎的分歧会污染该比值
GRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度
无模型强化学习方法(如Q-Learning、PPO)直接从与环境的交互中学习策略或价值函数,不显式建模环境的动态规律
智能体通过方向性控制器输入以及身体姿态调整(如俯仰角和高度)来完成爬坡任务
该项目让PPO算法获得对机器人控制器的完全控制权,而非直接输出关节角度
PPO等on-policy算法的训练通常需要1000万-5000万步,对于3-5架无人机规模PyBullet的CPU串行仿真速度已足够支撑
MPO通过引入KL散度约束来控制策略更新幅度,相比PPO或SAC在高维连续控制任务中表现出更好的稳定性和样本效率
对于3-5架无人机规模的项目,PyBullet在CPU上的串行仿真速度足以支撑PPO等on-policy算法的训练需求,GPU并行化的加速优势不显著
MAPPO是PPO的多智能体扩展,采用共享策略网络和集中式价值函数
MAPPO是PPO的多智能体扩展,采用共享策略网络和集中式价值函数,在StarCraft等基准测试中表现出色且训练稳定性好
34 more timeline events
All Facts (20)
RLHF(基于人类反馈的强化学习)是ChatGPT等对话模型背后的关键训练技术
90%VerifiedRLHF流程包含三步:训练奖励模型预测人类偏好分数、用PPO强化学习算法调整语言模型参数、通过KL散度约束防止模型偏离原有语言能力
90%Verified传统RLHF需要先训练奖励模型,再用PPO等强化学习算法优化,流程复杂且不稳定
80%VerifiedSFT-奖励模型-RLHF三阶段对齐训练范式最早由OpenAI在InstructGPT论文中系统提出
80%Verified当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)
80%VerifiedPPO(近端策略优化)是OpenAI在2017年提出的一种强化学习算法,成为RLHF的主流选择
80%VerifiedRLHF通过收集人类偏好评分训练奖励模型,再用PPO等强化学习算法微调语言模型,但奖励模型可能被对抗性输入欺骗,且无法穷举所有有害请求表达变体
75%VerifiedPPO的核心创新在于通过裁剪目标函数来限制策略更新的幅度,避免因单次更新过大导致训练崩溃
70%VerifiedPPO(Proximal Policy Optimization)是OpenAI于2017年提出的策略梯度算法,通过裁剪目标函数来限制每次策略更新的幅度
70%VerifiedPPO(近端策略优化)通过限制每次参数更新的幅度,在学习效率与训练稳定性之间取得平衡
65%VerifiedStable-Baselines3 基于 PyTorch 重构,提供工业级的 PPO、DQN、SAC 等算法实现
65%VerifiedPPO(近端策略优化)通过裁剪目标函数限制每次策略更新的步长,成为连续控制任务的事实标准
65%VerifiedPPO(近端策略优化)以其训练稳定性成为连续控制任务的事实标准,SAC(软演员-评论家)通过最大熵框架在样本效率上具有优势
65%Partially VerifiedRLHF是当前主流大语言模型(如GPT-4、Claude)对齐人类偏好的核心训练范式,通过收集人类偏好标注训练奖励模型再微调生成模型
75%UnverifiedPPO 算法需要计算旧策略概率与新策略概率的比值(importance ratio),两套引擎的分歧会污染该比值
50%UnverifiedGRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度
50%Unverified无模型强化学习方法(如Q-Learning、PPO)直接从与环境的交互中学习策略或价值函数,不显式建模环境的动态规律
50%Unverified该项目让PPO算法获得对机器人控制器的完全控制权,而非直接输出关节角度
50%Unverified智能体通过方向性控制器输入以及身体姿态调整(如俯仰角和高度)来完成爬坡任务
50%UnverifiedPPO等on-policy算法的训练通常需要1000万-5000万步,对于3-5架无人机规模PyBullet的CPU串行仿真速度已足够支撑
50%