Unverified50% confidenceFactExact time
主流大模型评测基准包括 MMLU、HumanEval/SWE-bench、MATH、GPQA 等
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
Grok 4.5实测:速度、准确性与性价比三维评测
redditr/cursor7/12/2026
Related Claims
Unverified主流 LLM 能力评测体系包括 MMLU、HumanEval、GSM8K 等标准化基准80% similarVerifiedMMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架79% similarVerifiedAI领域模型能力的可信评估依赖标准化基准测试,常见评测集包括MMLU、HumanEval、MATH、GPQA77% similarUnverifiedMMLU、HumanEval、MATH等基准测试用于量化模型能力差异75% similarUnverifiedMMLU、HumanEval、MT-Bench是AI社区广泛认可的标准化基准测试集75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/500912API
curl https://kongchang.com/api/v1/knowledge/claims/500912MCP
get_claim(id=500912)