[控场AI]
概念Direct Preference Optimization / 直接偏好优化

DPO

DPO(Direct Preference Optimization,直接偏好优化)是一种用于大语言模型偏好对齐的训练算法。其核心思想是将奖励模型隐式融入策略优化目标,通过直接在人类偏好数据上优化语言模型策略,无需显式训练独立的奖励模型和强化学习采样过程,仅依赖策略模型与参考模型即可完成对齐训练,是RLHF框架的一种简化替代方案。

核心事实

全部知识事实 (2)

来源文章