Unverified50% confidenceFactTime unknown
Codex One在SWE-bench上的表现略优于O3 High
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
OpenAI Codex Deep Dive: How Does the Async AI Coding Agent Actually Perform?
bilibiliKrillinAI小林
Related Claims
UnverifiedCodex One在SWE-bench上的表现略优于O3 High,在OpenAI内部软件工程任务上准确率达到75%,而O3 High为70%78% similarUnverified在编程基准测试中,Codex-1的表现超越了Claude 3.7和O3 High76% similarUnverified在SWE-Bench评分中,o1的得分远高于o3-mini medium,但略低于o3-mini-high64% similarUnverifiedSW1E1的能力接近Claude 3.7和Claude 3.5的水平,明显优于DeepSeek V361% similarUnverifiedCodex Max在SWE-Bench验证集上表现优于原始GPT 5.1 Codex,同时减少了30%的思考token60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/54738API
curl https://kongchang.com/api/v1/knowledge/claims/54738MCP
get_claim(id=54738)