待验证50% 置信基准精确时间
2021 年 Codex 论文(Chen et al.)在 GitHub 代码语料上完成专项预训练,并提出了 HumanEval 基准测试
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证HumanEval基准测试由OpenAI于2021年随Codex模型论文一同发布,包含164道编程题,Pass@1指一次生成即通过全部测试用例的比例67% 相似待验证Codex模型的评估通常使用HumanEval和MBPP等编码基准测试66% 相似已验证专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化66% 相似待验证HumanEval由OpenAI自研,专门测试代码生成的功能正确率65% 相似待验证GitHub与Claude Code的集成可在PR提交时自动分析改动范围、识别潜在风险点并建议测试覆盖63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/584716API
curl https://kongchang.com/api/v1/knowledge/claims/584716MCP
get_claim(id=584716)