待验证50% 置信事实精确时间
在类别不平衡场景下F1分数比准确率更能反映模型对少数类的识别能力
1
来源数
50%
置信度
长期有效
时效性
2026/8/29
首次发现
来源
涉及实体
相关事实
待验证On class-imbalanced datasets, Macro F1 is extremely sensitive to rare class performance, where small threshold changes cause dramatic fluctuations in precision and recall for rare classes77% 相似待验证在类别不平衡场景下单纯的准确率可能具有误导性,需要结合混淆矩阵进行更细粒度评估69% 相似待验证top-1%贪婪解码准确率只考察单token预测的一致性,无法捕捉量化对长序列生成质量的真实影响,微小偏差会在自回归生成中累积65% 相似待验证异构模型交叉审查因不同训练分布带来不同缺陷敏感性,能减少单一模型的同源偏见和认知盲区65% 相似待验证部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/821049API
curl https://kongchang.com/api/v1/knowledge/claims/821049MCP
get_claim(id=821049)