Unverified50% confidenceFactExact time
RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLHF存在奖励过优化(reward over-optimization)风险,模型可能学会取悦人类标注者的表面偏好而非真正提升准确性或安全性63% similarUnverifiedHuber损失在误差较小时表现为二次惩罚(与MSE一致),误差较大时退化为线性惩罚(与MAE一致),对异常值更鲁棒,常用于回归任务61% similarUnverified经过RLHF训练的模型在面对精心设计的越狱提示时往往能够绕过安全防护输出有害内容61% similarUnverified安全边界收紧会提高拒绝率阈值,导致误判率上升,即精确率-召回率权衡61% similarUnverifiedRLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/956116API
curl https://kongchang.com/api/v1/knowledge/claims/956116MCP
get_claim(id=956116)