待验证50% 置信基准精确时间
Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
VSCode接入DeepSeek V4:Claude Code插件配置完整教程
bilibili讲AI的薯条学姐2026/7/10
相关事实
待验证初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%83% 相似已验证Codex在HumanEval基准测试上达到了28.8%的pass@1准确率76% 相似待验证初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率69% 相似待验证早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%68% 相似待验证Opus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00066% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/486405API
curl https://kongchang.com/api/v1/knowledge/claims/486405MCP
get_claim(id=486405)