Unverified85% confidenceFactTime unknown
Codex Max在SWE-Bench验证集上表现优于原始GPT 5.1 Codex,同时减少了30%的思考token
1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
GPT-5.1 Pro深度评测:最聪明的AI困在最烂的界面里
bilibili安得广厦千万间678
Related Entities
Related Claims
UnverifiedClaude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点68% similarUnverifiedSWE-Bench评测中,Claude Code得分59分,Codex得分56.8分68% similarUnverifiedCodex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%65% similarUnverifiedCodex 的思考强度分为低、中、高、超高四档65% similarUnverified初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/12478API
curl https://kongchang.com/api/v1/knowledge/claims/12478MCP
get_claim(id=12478)