Unverified50% confidenceFactExact time
对齐税(Alignment Tax)指厂商在后训练阶段通过 RLHF 和安全微调降低有害输出概率时,往往导致模型在安全边界附近过度泛化,把无害请求也误判为危险请求并拒绝
1
Sources
50%
Confidence
Long-term
Relevance
8/22/2026
First Seen
Sources
Related Entities
Related Claims
Unverified不同厂商在RLHF阶段对安全性与有用性的权重取舍不同,过于强调规避风险会使模型给出保守、模糊、附带免责声明的回答76% similarUnverified安全分类器的核心困境在于精确率与召回率的权衡,调低阈值提高召回但增加误报,学术界称为对齐税70% similarUnverifiedRLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑64% similarUnverified过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景64% similarUnverified应对审批疲劳的合理做法是结合风险分级,高风险动作强制审批,低风险动作可配置自动放行64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/786767API
curl https://kongchang.com/api/v1/knowledge/claims/786767MCP
get_claim(id=786767)