待验证50% 置信基准精确时间
初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率
1
来源数
50%
置信度
长期有效
时效性
2026/7/23
首次发现
来源
相关事实
已验证Codex在HumanEval基准测试上达到了28.8%的pass@1准确率83% 相似待验证早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平72% 相似待验证Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%69% 相似待验证初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%68% 相似待验证Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/596140API
curl https://kongchang.com/api/v1/knowledge/claims/596140MCP
get_claim(id=596140)