待验证50% 置信事实精确时间
评估智能体编程能力的主流基准包括SWE-bench、SWE-bench Verified和HumanEval
1
来源数
50%
置信度
长期有效
时效性
2026/8/17
首次发现
来源
相关事实
待验证代码生成领域的模型评估如HumanEval、SWE-bench格外强调功能正确性而非流畅度79% 相似待验证AI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)77% 相似待验证评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench76% 相似待验证SWE-bench 涉及跨文件依赖分析、版本兼容性判断、回归测试通过等高阶能力,难度比 HumanEval 等写函数类基准更贴近真实工程场景75% 相似已验证评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/763820API
curl https://kongchang.com/api/v1/knowledge/claims/763820MCP
get_claim(id=763820)