待验证60% 置信事实精确时间
Benchmark(基准评测)是用一套固定题目给模型打分做横向对比,类似模拟考,用于给模型排名
2
来源数
60%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
待验证评测游戏(Benchmark Gaming)指AI公司通过选择性使用特定基准测试来最大化模型表现分数的行为,包括数据污染和针对特定评测集过度优化73% 相似待验证criterion通常配合cargo bench命令使用,将benchmark定义为独立的测试目标73% 相似待验证基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准72% 相似待验证单点benchmark评估可能系统性地偏向某类模型,需在多个推理预算档位下综合评估71% 相似待验证基准测试污染(Benchmark Contamination)是指模型在训练过程中有意或无意接触到评测集数据,从而在测试中获得虚高分数68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/943510API
curl https://kongchang.com/api/v1/knowledge/claims/943510MCP
get_claim(id=943510)