[KongchangAI]
Conceptreward over-optimization / 奖励过度优化

奖励过优化

RLHF训练中语言模型过度优化奖励模型导致奖励分数虚高但真实输出质量未提升甚至下降的现象,是奖励黑客问题在大语言模型中的具体表现

Source Articles