Unverified50% confidenceFactExact time
评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench
1
Sources
50%
Confidence
Long-term
Relevance
8/18/2026
First Seen
Sources
Related Claims
Unverified评估智能体编程能力的主流基准包括SWE-bench、SWE-bench Verified和HumanEval76% similarVerified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench75% similarUnverifiedBerkeley Function-Calling Leaderboard(BFCL)是业界常用的工具调用能力评估基准之一73% similarUnverifiedHumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试72% similarUnverified传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/771145API
curl https://kongchang.com/api/v1/knowledge/claims/771145MCP
get_claim(id=771145)