Unverified50% confidenceFactTime unknown
通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
AI周报:GPT 6代号Spud曝光、Claude Conway代理、DeepSeek V4转向华为芯片
bilibiliAI-seeker
Related Claims
Unverified在SABench基准测试中,Claude Opus 4.7得分约33分,而人类高级工程师得分80-90分75% similarPartially VerifiedClaude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%75% similarVerifiedClaude 4.5 Opus 在 SWE-Bench Verified 上达到了 80.9% 的成绩74% similarVerifiedGemini 3.1 Pro在高级推理基准测试中达到77%,而Claude Opus 4.6为68%73% similarUnverifiedClaude Opus 4.6在SWE-Bench Pro测试中得分为53.4%72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/60806API
curl https://kongchang.com/api/v1/knowledge/claims/60806MCP
get_claim(id=60806)