[控场AI]
概念over-alignment / 过度谨慎 / over-refusal

过度对齐

AI安全领域术语,指大语言模型因训练数据或评估标准过于保守,导致模型拒绝合理请求、回避正常表达或对无害指令附加说教的现象,是对齐目标函数设定偏差的产物

时间轴 (近 90 天)

9月28日

当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税

待验证50%

全部知识事实 (1)

来源文章