Unverified50% confidenceFactExact time
过度对齐(Over-alignment)指模型安全护栏设置过于敏感,在完全合法的使用场景中也拒绝提供帮助的反向风险
1
Sources
50%
Confidence
Long-term
Relevance
8/16/2026
First Seen
Sources
Related Claims
Verified过度的安全微调会导致模型过度拒绝(over-refusal),损害实用性79% similarUnverified过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景70% similarUnverified安全研究者将系统行动能力远超其安全判断能力的潜在风险称为能力越界(Capability Overhang)67% similarUnverified过于频繁的人工干预会消除自动化的效率优势,而过于宽松的审批范围则无法有效防控风险,这是HITL粒度设计的权衡66% similarUnverified过度授权(如在只需生成文档时同时开放命令执行权限)会因提示词注入攻击或模型幻觉引入破坏性操作的安全风险65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/757385API
curl https://kongchang.com/api/v1/knowledge/claims/757385MCP
get_claim(id=757385)