Unverified50% confidenceFactTime unknown
过度对齐(over-alignment)问题导致模型在完全无害的场景中也会频繁拒绝正常创意写作和角色扮演请求
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
UnverifiedRLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求83% similarUnverified模型调用会带来不可预测性,即使技能完美契合任务模型也可能选择不调用它69% similarUnverified模型驱动的方式在复杂业务场景下可能缺乏足够的可控性,完全依赖模型自主决策可能带来不可预测的行为68% similarUnverified最新研究"The Danger of Overthinking"指出能做脑内模拟的模型存在想太多的问题,有些模型反复思考却不行动甚至还没尝试就自我放弃67% similarUnverified当模型本身缺乏对特定问题的理解能力时,再精巧的提示词也无法弥补这一缺陷67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/57052API
curl https://kongchang.com/api/v1/knowledge/claims/57052MCP
get_claim(id=57052)