[控场AI]
基准Expected Calibration Error / 期望校准误差

ECE

机器学习中用于评估模型置信度校准程度的定量指标,计算各置信度区间内预测置信度与实际准确率之差的加权平均值,数值越低表示校准越好

核心事实

时间轴 (近 90 天)

10月8日

点估计置信度在分布偏移下会失效,而MC Dropout等贝叶斯式不确定性度量能真正识别信号失效

待验证50%
10月8日

八对事件中有七对的期望校准误差(ECE)上升,受影响场景中有12%-51%的区域被模型以接近零精度自信地错标

待验证50%
10月7日

在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05

待验证50%
9月28日

作者发现只用 batch 范围内的全局 -λ·ECE 惩罚几乎不起作用,因为它会被 PPO 或 GRPO 的 baseline 直接吸收抵消

待验证50%
9月28日

RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励

待验证50%
9月28日

校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息

待验证50%
9月27日

置信度校准通常通过可靠性图和期望校准误差(ECE)来度量

待验证50%
9月16日

良好校准的模型指在所有输出概率为 P 的预测上实际正确率也接近 P,校准质量常用 ECE(期望校准误差)指标衡量

待验证50%
7月21日

校准是指模型给出的置信度与实际频率相符的程度,常通过可靠性图和期望校准误差(ECE)来量化

待验证50%

全部知识事实 (10)

已验证

期望校准误差(ECE)通过将预测样本按置信度分桶,计算每桶内预测置信度与实际准确率之差的加权平均值,理想情况下趋近于0

75%
待验证

点估计置信度在分布偏移下会失效,而MC Dropout等贝叶斯式不确定性度量能真正识别信号失效

50%
待验证

八对事件中有七对的期望校准误差(ECE)上升,受影响场景中有12%-51%的区域被模型以接近零精度自信地错标

50%
待验证

在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05

50%
待验证

RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励

50%
待验证

作者发现只用 batch 范围内的全局 -λ·ECE 惩罚几乎不起作用,因为它会被 PPO 或 GRPO 的 baseline 直接吸收抵消

50%
待验证

校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息

50%
待验证

置信度校准通常通过可靠性图和期望校准误差(ECE)来度量

50%
待验证

良好校准的模型指在所有输出概率为 P 的预测上实际正确率也接近 P,校准质量常用 ECE(期望校准误差)指标衡量

50%
待验证

校准是指模型给出的置信度与实际频率相符的程度,常通过可靠性图和期望校准误差(ECE)来量化

50%

来源文章