Partially Verified70% confidenceFactExact time
Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%
4
Sources
70%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Claude Opus 4.8代码能力登顶,却暴露AI训练致命隐患
bilibili智视界6/23/2026
Related Claims
UnverifiedOpus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00079% similarVerifiedGemini 3.1 Pro在高级推理基准测试中达到77%,而Claude Opus 4.6为68%79% similarUnverified在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)79% similarUnverifiedGPT-5.6在Agent's Last Exam测试中以53.6分创下历史新高,领先Claude Opus 4.5达13.1分78% similarVerified在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/40945API
curl https://kongchang.com/api/v1/knowledge/claims/40945MCP
get_claim(id=40945)