部分验证70% 置信事实精确时间
Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%
4
来源数
70%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Claude Opus 4.8代码能力登顶,却暴露AI训练致命隐患
bilibili智视界2026/6/23
相关事实
待验证Opus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00079% 相似已验证Gemini 3.1 Pro在高级推理基准测试中达到77%,而Claude Opus 4.6为68%79% 相似待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)79% 相似待验证GPT-5.6在Agent's Last Exam测试中以53.6分创下历史新高,领先Claude Opus 4.5达13.1分78% 相似已验证在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高78% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/40945API
curl https://kongchang.com/api/v1/knowledge/claims/40945MCP
get_claim(id=40945)