Unverified50% confidenceTradeoffExact time
RLHF存在奖励过优化(reward over-optimization)风险,模型可能学会取悦人类标注者的表面偏好而非真正提升准确性或安全性
1
Sources
50%
Confidence
Long-term
Relevance
9/17/2026
First Seen
Sources
Related Entities
Related Claims
Verified传统RLHF方法存在「奖励黑客」的根本性局限,模型可能学会在评估场景中表现良好却在分布外场景中失效75% similarUnverified经过RLHF训练的模型在面对精心设计的越狱提示时往往能够绕过安全防护输出有害内容72% similarUnverified不同厂商在RLHF阶段对安全性与有用性的权重取舍不同,过于强调规避风险会使模型给出保守、模糊、附带免责声明的回答70% similarUnverifiedRLHF 的主要挑战包括人工标注成本高昂、奖励模型可能被欺骗(reward hacking)、流程复杂难以复现70% similarVerified部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/929138API
curl https://kongchang.com/api/v1/knowledge/claims/929138MCP
get_claim(id=929138)