待验证80% 置信观点时间未知
测试者评估Codex大概能完成看板上30%的任务
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
OpenAI Codex深度实测:异步AI编程Agent真实表现如何
bilibiliKrillinAI小林
涉及实体
相关事实
待验证早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平73% 相似待验证评测者认为通义千问3.6 27B是30B级别中对高考数学题表现最好的模型70% 相似待验证向 Codex 发出'无论消耗多少额度,修复完要做真实测试,真实发请求验证API能否返回结果,反复测试直到成功'的指令后,Codex 运行了36分钟,最终自主完成了调试69% 相似已验证Codex在HumanEval基准测试上达到了28.8%的pass@1准确率64% 相似待验证初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/4992API
curl https://kongchang.com/api/v1/knowledge/claims/4992MCP
get_claim(id=4992)