Unverified85% confidenceFactTime unknown
RLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求
1
Sources
85%
Confidence
Long-term
Relevance
6/3/2026
First Seen
Sources
高自由度AI伴侣聊天软件实测:无限制角色扮演对话体验
bilibili风铃草不夜侯
Related Entities
Related Claims
Unverified过度对齐(over-alignment)问题导致模型在完全无害的场景中也会频繁拒绝正常创意写作和角色扮演请求83% similarUnverifiedAI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝70% similarUnverifiedRLHF中人类评审倾向给流畅自信全面的答案更高分而较少关注事实核查,导致模型获得隐性激励表现得有把握比实际有把握更重要70% similarUnverifiedRLHF对流畅性和自信表述的优化可能反而强化了自信但错误的表述67% similarUnverified最新研究"The Danger of Overthinking"指出能做脑内模拟的模型存在想太多的问题,有些模型反复思考却不行动甚至还没尝试就自我放弃64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/38474API
curl https://kongchang.com/api/v1/knowledge/claims/38474MCP
get_claim(id=38474)