Unverified50% confidenceFactExact time
AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝
1
Sources
50%
Confidence
Long-term
Relevance
8/6/2026
First Seen
Sources
Related Claims
UnverifiedMeta AI研究团队将过度拒绝现象称为假阳性拒绝(false positive refusal),根源在于模型训练时过度依赖表面语义特征而非深层语境理解78% similarUnverified过度对齐(Overalignment)现象指模型在边界情形下倾向过度拒绝合理请求,是Constitutional AI安全优先策略的潜在代价74% similarUnverified主动要求AI引入可信瑕疵可以对抗模型的讨好性偏差,从而提升输出的真实度73% similarUnverified直接让AI做逆向分析可能会触发模型的道德/合规约束而拒绝执行72% similarUnverified在prompt中明确要求AI不确定时直接说明不要编造,能有效降低模型的讨好冲动71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/699103API
curl https://kongchang.com/api/v1/knowledge/claims/699103MCP
get_claim(id=699103)