Unverified60% confidenceFactExact time
Benchmark(基准评测)是用一套固定题目给模型打分做横向对比,类似模拟考,用于给模型排名
2
Sources
60%
Confidence
Long-term
Relevance
9/23/2026
First Seen
Sources
Related Entities
Related Claims
Unverified评测游戏(Benchmark Gaming)指AI公司通过选择性使用特定基准测试来最大化模型表现分数的行为,包括数据污染和针对特定评测集过度优化73% similarUnverifiedcriterion通常配合cargo bench命令使用,将benchmark定义为独立的测试目标73% similarUnverified基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准72% similarUnverified单点benchmark评估可能系统性地偏向某类模型,需在多个推理预算档位下综合评估71% similarUnverified基准测试污染(Benchmark Contamination)是指模型在训练过程中有意或无意接触到评测集数据,从而在测试中获得虚高分数68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/943510API
curl https://kongchang.com/api/v1/knowledge/claims/943510MCP
get_claim(id=943510)