已验证70% 置信事实时间未知
Codex在HumanEval基准测试上达到了28.8%的pass@1准确率
4
来源数
70%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
GPT-4 Thinking深度评测:编程、Agent与写作能力实测对比
bilibiliAI技术研究院
涉及实体
相关事实
待验证初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率83% 相似待验证早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平81% 相似待验证Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%76% 相似待验证初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%76% 相似待验证向 Codex 发出'无论消耗多少额度,修复完要做真实测试,真实发请求验证API能否返回结果,反复测试直到成功'的指令后,Codex 运行了36分钟,最终自主完成了调试64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13593API
curl https://kongchang.com/api/v1/knowledge/claims/13593MCP
get_claim(id=13593)