待验证75% 置信事实时间未知
Terminal-Bench评测中,Codex得分77.3分,Claude Code得分65.4分
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Codex vs Claude Code实测对比:$20档位真实差距有多大
bilibili赋范AI课堂
涉及实体
相关事实
待验证SWE-Bench评测中,Claude Code得分59分,Codex得分56.8分82% 相似待验证在SWE-Bench基准测试中,Codex得分在69-80分之间70% 相似待验证Qwen3.6 27B 在 Terminal-bench 得分83分,综合能力约59分65% 相似已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点65% 相似待验证Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/5990API
curl https://kongchang.com/api/v1/knowledge/claims/5990MCP
get_claim(id=5990)