待验证50% 置信基准精确时间
最强配置GPT-5.5配合Codex在Harbor-Index上的通过率仅为28.0%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%74% 相似待验证Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%71% 相似待验证Opus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00070% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%66% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/902670API
curl https://kongchang.com/api/v1/knowledge/claims/902670MCP
get_claim(id=902670)