概念Multi-Objective Direct Preference Optimization / 多目标直接偏好优化
MODPO
多目标直接偏好优化方法,在传统DPO基础上引入目标权重向量,使模型能够在多个相互竞争的对齐目标之间平滑过渡,形成帕累托前沿近似的权衡谱线
时间轴 (近 90 天)
9月24日
多目标直接偏好优化(MODPO)引入了「目标权重」参数,通过调节权重可在多个竞争目标之间形成连续的权衡谱线
待验证50%
9月24日
MODPO的权衡谱线构成了多目标优化理论中帕累托前沿(Pareto Frontier)的一个近似
待验证50%
9月24日
选择参数上最接近的已训练模型来近似特定权衡点是一种有一定效果的方法
待验证50%