Unverified50% confidenceBenchmarkExact time
HumanEval基准测试由OpenAI于2021年随Codex模型论文一同发布,包含164道编程题,Pass@1指一次生成即通过全部测试用例的比例
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
VerifiedHumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题82% similarUnverifiedHumanEval由OpenAI自研,专门测试代码生成的功能正确率73% similarUnverifiedCodex模型的评估通常使用HumanEval和MBPP等编码基准测试71% similarUnverified2021 年 Codex 论文(Chen et al.)在 GitHub 代码语料上完成专项预训练,并提出了 HumanEval 基准测试67% similarUnverifiedHumanEval专注代码生成能力,以164道编程题检验模型的逻辑推理与代码正确性66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/592717API
curl https://kongchang.com/api/v1/knowledge/claims/592717MCP
get_claim(id=592717)