Verified65% confidenceFactExact time
HumanEval基准包含164道编程题,是衡量代码生成能力的主流标准
3
Sources
65%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedHumanEval专注代码生成能力,以164道编程题检验模型的逻辑推理与代码正确性83% similarUnverified从3万行代码中精准找出有问题的300行,需要人类专家完全理解代码并快速定位,这是人类价值的核心71% similarUnverified代码生成领域的模型评估如HumanEval、SWE-bench格外强调功能正确性而非流畅度70% similarVerifiedHumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题69% similarUnverifiedHumanEval等传统代码评测基准通常只要求模型根据函数签名和文档字符串生成独立函数,本质上是受限的代码补全任务68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/575607API
curl https://kongchang.com/api/v1/knowledge/claims/575607MCP
get_claim(id=575607)