Unverified50% confidenceFactExact time
部分厂商存在针对评测集过度优化(刷榜/benchmark contamination)的倾向,导致分数膨胀但泛化能力不足
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified基准测试存在「饱和」和「数据污染」等局限,这是业界持续开发新评测集的原因74% similarVerified部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)73% similarUnverified厂商针对特定基准优化会导致基准分数提升与真实使用能力改善脱节,即benchmark hacking问题72% similarVerified若用含测试集的全量数据计算均值和标准差,会导致预处理泄漏,使评估指标虚高,无法真实反映模型泛化能力72% similarUnverified评分校准是关键技术难点,模型必须能大量给出低分,否则过滤系统失去意义71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829389API
curl https://kongchang.com/api/v1/knowledge/claims/829389MCP
get_claim(id=829389)