待验证60% 置信基准精确时间
初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%
2
来源数
60%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
国内直连Codex配置教程:GPT Agent完整上手指南
bilibili无汁西瓜2026/6/26
相关事实
待验证Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%83% 相似已验证Codex在HumanEval基准测试上达到了28.8%的pass@1准确率76% 相似待验证初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率68% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%66% 相似待验证Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/488714API
curl https://kongchang.com/api/v1/knowledge/claims/488714MCP
get_claim(id=488714)