待验证50% 置信权衡取舍精确时间
校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
待验证严格正确评分规则的核心性质是当且仅当预测者报告真实相信的概率时期望得分最大,常见例子包括对数似然损失和Brier分数67% 相似待验证输出质量的一致性在benchmark分数上往往难以体现,一个平均分高但偶发严重错误的模型在某些业务场景下的风险高于稳定但稍弱的模型66% 相似待验证对于类别策略,随着输出分布变得越来越尖锐,其期望的 score-gradient 范数会趋近于零,使得自信但错误的 token 得到的更新最微弱66% 相似待验证在正负样本极度不均衡的场景(如欺诈检测)中,单纯看准确率作为评估指标毫无意义66% 相似已验证期望校准误差(ECE)通过将预测样本按置信度分桶,计算每桶内预测置信度与实际准确率之差的加权平均值,理想情况下趋近于065% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/956120API
curl https://kongchang.com/api/v1/knowledge/claims/956120MCP
get_claim(id=956120)