Unverified50% confidenceBenchmarkExact time
HumanEval、MBPP、SWE-bench是专门针对代码生成的标准评测集
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
UnverifiedHumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试83% similarVerified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench81% similarUnverifiedHumanEval、SWE-bench等代码评测基准的排名是评估执行型Agent底层模型选型的重要参考维度79% similarUnverified代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确76% similarUnverified传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/535381API
curl https://kongchang.com/api/v1/knowledge/claims/535381MCP
get_claim(id=535381)