Unverified50% confidenceFactExact time
对齐税指模型被过度训练拒绝有害请求时,其拒绝边界可能泛化到正常无害场景,导致过度谨慎
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Verified过度的安全微调会导致模型过度拒绝(over-refusal),损害实用性74% similarUnverified漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化73% similarUnverified对齐税(Alignment Tax)指厂商在后训练阶段通过 RLHF 和安全微调降低有害输出概率时,往往导致模型在安全边界附近过度泛化,把无害请求也误判为危险请求并拒绝73% similarUnverified过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景72% similarVerified部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829241API
curl https://kongchang.com/api/v1/knowledge/claims/829241MCP
get_claim(id=829241)