Unverified50% confidenceTradeoffExact time
过度对齐(Overalignment)现象指模型在边界情形下倾向过度拒绝合理请求,是Constitutional AI安全优先策略的潜在代价
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedAI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝74% similarUnverified在AI安全领域,失准指模型的实际行为偏离设计者或使用者意图的现象,当代大模型的失准更多表现为目标过度追求69% similarUnverified告知AI总集数会使模型倾向于分散布局矛盾冲突,避免过早消耗核心看点67% similarVerified过度依赖AI可能带来思维惰性、技能退化和信息茧房等潜在风险67% similarUnverified转人工触发条件过于保守会导致AI承接率低失去降本意义,过于激进则让复杂问题滞留AI端损害客户体验67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/518248API
curl https://kongchang.com/api/v1/knowledge/claims/518248MCP
get_claim(id=518248)