Verified80% confidenceFactTime unknown
HumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题
15
Sources
80%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Mistral Vibe完全指南:免费API驱动的终端AI编程助手
bilibili薛定猫AI
Related Entities
Related Claims
UnverifiedHumanEval基准测试由OpenAI于2021年随Codex模型论文一同发布,包含164道编程题,Pass@1指一次生成即通过全部测试用例的比例82% similarUnverifiedHumanEval由OpenAI自研,专门测试代码生成的功能正确率80% similarUnverifiedHumanEval测试代码生成能力,要求模型根据函数签名和文档字符串生成正确的Python代码74% similarUnverifiedHumanEval专注代码生成能力,以164道编程题检验模型的逻辑推理与代码正确性70% similarVerifiedHumanEval基准包含164道编程题,是衡量代码生成能力的主流标准69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/25134API
curl https://kongchang.com/api/v1/knowledge/claims/25134MCP
get_claim(id=25134)