Verified65% confidenceCautionExact time
RLHF存在Reward Hacking问题,模型可能学会讨好奖励模型而非真正提升回答质量,表现为回答冗长
3
Sources
65%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
吴恩达提示词工程课精华:开发者必学的核心方法论
bilibiliAgent吴恩达6/29/2026
Related Claims
UnverifiedRLHF是InstructGPT和ChatGPT能力跃升的核心技术,但存在奖励模型被过度优化(reward hacking)的内在风险79% similarVerifiedRLHF通过收集人类偏好评分训练奖励模型,再用PPO等强化学习算法微调语言模型,但奖励模型可能被对抗性输入欺骗,且无法穷举所有有害请求表达变体75% similarUnverifiedRLHF机制存在结构性偏置,任务已完成比任务存在问题更容易获得正向反馈,使模型倾向报告积极结果73% similarUnverified在 RLHF 流程中,奖励模型的质量直接决定了最终模型的对话体验上限,收集人类偏好数据成本极高72% similarVerifiedRLHF训练中,'有帮助且详细的答案'几乎总是获得更高分数,导致模型学会在不确定时也生成看起来完整专业的回答72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/460707API
curl https://kongchang.com/api/v1/knowledge/claims/460707MCP
get_claim(id=460707)