待验证50% 置信事实精确时间
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
待验证对齐税指模型被过度训练拒绝有害请求时,其拒绝边界可能泛化到正常无害场景,导致过度谨慎80% 相似待验证过于激进的LLM路由会将复杂推理错判为简单闲聊导致输出质量下降,过于保守则失去成本节约意义72% 相似已验证前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为70% 相似已验证漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化69% 相似待验证当前对齐方法主要依赖训练阶段的行为塑造,在面对精心设计的对抗性提示时安全边界可能被突破,这种现象称为'越狱'(jailbreaking)68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/957710API
curl https://kongchang.com/api/v1/knowledge/claims/957710MCP
get_claim(id=957710)