待验证50% 置信事实精确时间
RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
待验证RLHF存在奖励过优化(reward over-optimization)风险,模型可能学会取悦人类标注者的表面偏好而非真正提升准确性或安全性63% 相似待验证Huber损失在误差较小时表现为二次惩罚(与MSE一致),误差较大时退化为线性惩罚(与MAE一致),对异常值更鲁棒,常用于回归任务61% 相似待验证经过RLHF训练的模型在面对精心设计的越狱提示时往往能够绕过安全防护输出有害内容61% 相似待验证安全边界收紧会提高拒绝率阈值,导致误判率上升,即精确率-召回率权衡61% 相似待验证RLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/956116API
curl https://kongchang.com/api/v1/knowledge/claims/956116MCP
get_claim(id=956116)