ECE
机器学习中用于评估模型置信度校准程度的定量指标,计算各置信度区间内预测置信度与实际准确率之差的加权平均值,数值越低表示校准越好
核心事实
时间轴 (近 90 天)
点估计置信度在分布偏移下会失效,而MC Dropout等贝叶斯式不确定性度量能真正识别信号失效
八对事件中有七对的期望校准误差(ECE)上升,受影响场景中有12%-51%的区域被模型以接近零精度自信地错标
在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05
作者发现只用 batch 范围内的全局 -λ·ECE 惩罚几乎不起作用,因为它会被 PPO 或 GRPO 的 baseline 直接吸收抵消
RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息
置信度校准通常通过可靠性图和期望校准误差(ECE)来度量
良好校准的模型指在所有输出概率为 P 的预测上实际正确率也接近 P,校准质量常用 ECE(期望校准误差)指标衡量
校准是指模型给出的置信度与实际频率相符的程度,常通过可靠性图和期望校准误差(ECE)来量化
全部知识事实 (10)
期望校准误差(ECE)通过将预测样本按置信度分桶,计算每桶内预测置信度与实际准确率之差的加权平均值,理想情况下趋近于0
75%待验证点估计置信度在分布偏移下会失效,而MC Dropout等贝叶斯式不确定性度量能真正识别信号失效
50%待验证八对事件中有七对的期望校准误差(ECE)上升,受影响场景中有12%-51%的区域被模型以接近零精度自信地错标
50%待验证在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05
50%待验证RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
50%待验证作者发现只用 batch 范围内的全局 -λ·ECE 惩罚几乎不起作用,因为它会被 PPO 或 GRPO 的 baseline 直接吸收抵消
50%待验证校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息
50%待验证置信度校准通常通过可靠性图和期望校准误差(ECE)来度量
50%待验证良好校准的模型指在所有输出概率为 P 的预测上实际正确率也接近 P,校准质量常用 ECE(期望校准误差)指标衡量
50%待验证校准是指模型给出的置信度与实际频率相符的程度,常通过可靠性图和期望校准误差(ECE)来量化
50%