[
KongchangAI
]
Feed
Entities
Podcasts
Deep Dives
Developers
About
Get CLI
中文
Concept
reward over-optimization / 奖励过度优化
奖励过优化
RLHF训练中语言模型过度优化奖励模型导致奖励分数虚高但真实输出质量未提升甚至下降的现象,是奖励黑客问题在大语言模型中的具体表现
Source Articles
当AI学会"投机取巧":对话幽默训练中的奖励漏洞与对策
Oct 2