Unverified50% confidenceOpinionExact time
HumanEval、SWE-bench等代码评测基准的排名是评估执行型Agent底层模型选型的重要参考维度
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
开源AI助手对接OpenClaw龙虾实战:本地智能体配置全流程
bilibili枫影剑wind7/4/2026
Related Claims
UnverifiedHumanEval、MBPP、SWE-bench是专门针对代码生成的标准评测集79% similarUnverifiedHumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试76% similarUnverified代码生成领域的模型评估如HumanEval、SWE-bench格外强调功能正确性而非流畅度76% similarVerified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench76% similarUnverified锚定样本技术在评估提示词中加入已由人类专家标注明确分数的示例,覆盖评分量表各个档位,可帮助裁判模型准确理解评分标准76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114299API
curl https://kongchang.com/api/v1/knowledge/claims/114299MCP
get_claim(id=114299)