Conceptover-alignment / 过度谨慎 / over-refusal
过度对齐
AI安全领域术语,指大语言模型因训练数据或评估标准过于保守,导致模型拒绝合理请求、回避正常表达或对无害指令附加说教的现象,是对齐目标函数设定偏差的产物
Timeline (last 90 days)
Sep 28
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税
Unverified50%
AI安全领域术语,指大语言模型因训练数据或评估标准过于保守,导致模型拒绝合理请求、回避正常表达或对无害指令附加说教的现象,是对齐目标函数设定偏差的产物
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税