[KongchangAI]
ConceptDirect Preference Optimization / 直接偏好优化

DPO

DPO(Direct Preference Optimization,直接偏好优化)是一种用于大语言模型偏好对齐的训练算法。其核心思想是将奖励模型隐式融入策略优化目标,通过直接在人类偏好数据上优化语言模型策略,无需显式训练独立的奖励模型和强化学习采样过程,仅依赖策略模型与参考模型即可完成对齐训练,是RLHF框架的一种简化替代方案。

Core Facts

Timeline (last 90 days)

Aug 28

模型对齐通过RLHF、DPO等技术使模型输出符合人类期望,对齐调整会影响模型的输出长度和风格

Unverified50%
Aug 28

DPO 相比 PPO 实现简单、稳定性高、资源友好,但对偏好数据质量要求高,且使用离线偏好数据限制了训练中的策略探索能力

Unverified50%
Aug 28

DPO 由 Rafailov 等人于 2023 年提出,通过数学变换绕过奖励模型,直接用偏好数据优化策略模型

Unverified50%
Aug 27

Qwen2.5系列在后训练阶段引入了大量工具调用对齐数据,并通过RLHF和DPO强化了结构化输出的可靠性

Unverified50%
Aug 27

DPO方法利用奖励函数与最优策略之间的解析关系,将RL问题转化为更简单的监督学习问题

Unverified50%
Aug 23

缓解长度偏差的学术方案包括长度归一化奖励、DPO中的长度正则化、相同长度区间偏好比较、Constitutional AI和RLAIF

Unverified50%
Jul 23

从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段

Partially Verified65%
Jul 10

语言模型对齐技术包括基于人类反馈的强化学习(RLHF)和直接偏好优化(DPO),旨在使模型行为符合人类意图与价值观

Unverified50%
Jun 3

Gemini 3.5 Flash的性能进步很大程度上得益于后训练技术的优化,包括RLHF、指令微调和DPO等技术

Expired60%
Jun 3

大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐

Verified65%

1 more timeline events

All Facts (10)

Source Articles