待验证50% 置信事实时间未知
通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
AI周报:GPT 6代号Spud曝光、Claude Conway代理、DeepSeek V4转向华为芯片
bilibiliAI-seeker
相关事实
待验证在SABench基准测试中,Claude Opus 4.7得分约33分,而人类高级工程师得分80-90分75% 相似部分验证Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%75% 相似已验证Claude 4.5 Opus 在 SWE-Bench Verified 上达到了 80.9% 的成绩74% 相似已验证Gemini 3.1 Pro在高级推理基准测试中达到77%,而Claude Opus 4.6为68%73% 相似待验证Claude Opus 4.6在SWE-Bench Pro测试中得分为53.4%72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/60806API
curl https://kongchang.com/api/v1/knowledge/claims/60806MCP
get_claim(id=60806)