待验证85% 置信事实时间未知
RLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求
1
来源数
85%
置信度
长期有效
时效性
2026/6/3
首次发现
来源
高自由度AI伴侣聊天软件实测:无限制角色扮演对话体验
bilibili风铃草不夜侯
涉及实体
相关事实
待验证过度对齐(over-alignment)问题导致模型在完全无害的场景中也会频繁拒绝正常创意写作和角色扮演请求83% 相似待验证AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝70% 相似待验证RLHF中人类评审倾向给流畅自信全面的答案更高分而较少关注事实核查,导致模型获得隐性激励表现得有把握比实际有把握更重要70% 相似待验证RLHF对流畅性和自信表述的优化可能反而强化了自信但错误的表述67% 相似待验证最新研究"The Danger of Overthinking"指出能做脑内模拟的模型存在想太多的问题,有些模型反复思考却不行动甚至还没尝试就自我放弃64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/38474API
curl https://kongchang.com/api/v1/knowledge/claims/38474MCP
get_claim(id=38474)