概念over-alignment / 过度谨慎 / over-refusal
过度对齐
AI安全领域术语,指大语言模型因训练数据或评估标准过于保守,导致模型拒绝合理请求、回避正常表达或对无害指令附加说教的现象,是对齐目标函数设定偏差的产物
时间轴 (近 90 天)
9月28日
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税
待验证50%
AI安全领域术语,指大语言模型因训练数据或评估标准过于保守,导致模型拒绝合理请求、回避正常表达或对无害指令附加说教的现象,是对齐目标函数设定偏差的产物
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税