Verified75% confidenceFactTime unknown
评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
5
Sources
75%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
GPT-4 Thinking深度评测:编程、Agent与写作能力实测对比
bilibiliAI技术研究院
Related Entities
Related Claims
UnverifiedHumanEval、MBPP、SWE-bench是专门针对代码生成的标准评测集81% similarUnverified代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确78% similarUnverifiedSWE-bench相比HumanEval、MBPP等传统基准更贴近实际开发场景,考验模型对大型代码库的理解、跨文件依赖追踪和缺陷定位能力76% similarUnverifiedHumanEval、SWE-bench等代码评测基准的排名是评估执行型Agent底层模型选型的重要参考维度76% similarUnverified评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13594API
curl https://kongchang.com/api/v1/knowledge/claims/13594MCP
get_claim(id=13594)