Unverified50% confidenceFactExact time
当对齐训练的惩罚信号过强,模型会趋向于宁可少说绝不出错的保守策略,导致回答冗长、前置免责、绕圈子,这种现象被称为过度对齐或对齐税
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
Unverified对齐税指模型被过度训练拒绝有害请求时,其拒绝边界可能泛化到正常无害场景,导致过度谨慎80% similarUnverified过于激进的LLM路由会将复杂推理错判为简单闲聊导致输出质量下降,过于保守则失去成本节约意义72% similarVerified前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为70% similarVerified漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化69% similarUnverified当前对齐方法主要依赖训练阶段的行为塑造,在面对精心设计的对抗性提示时安全边界可能被突破,这种现象称为'越狱'(jailbreaking)68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/957710API
curl https://kongchang.com/api/v1/knowledge/claims/957710MCP
get_claim(id=957710)