Unverified50% confidenceFactExact time
RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求72% similarUnverifiedRLHF中人类评审倾向给流畅自信全面的答案更高分而较少关注事实核查,导致模型获得隐性激励表现得有把握比实际有把握更重要71% similarUnverifiedRLHF对流畅性和自信表述的优化可能反而强化了自信但错误的表述69% similarUnverifiedRL智能体的行为完全由奖励信号驱动,物理规则偏差在影响奖励之前对其几乎不可见68% similarUnverified过度对齐本质上是对齐目标函数设定偏差的产物,模型学会了不被批评而非真正有帮助67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/956109API
curl https://kongchang.com/api/v1/knowledge/claims/956109MCP
get_claim(id=956109)