待验证50% 置信事实精确时间
对齐税指模型被过度训练拒绝有害请求时,其拒绝边界可能泛化到正常无害场景,导致过度谨慎
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
已验证过度的安全微调会导致模型过度拒绝(over-refusal),损害实用性74% 相似待验证漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化73% 相似待验证对齐税(Alignment Tax)指厂商在后训练阶段通过 RLHF 和安全微调降低有害输出概率时,往往导致模型在安全边界附近过度泛化,把无害请求也误判为危险请求并拒绝73% 相似待验证过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景72% 相似已验证部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/829241API
curl https://kongchang.com/api/v1/knowledge/claims/829241MCP
get_claim(id=829241)