Unverified90% confidenceFactTime unknown
在困难题中,Claude Sonnet 4.6拿下全场最高93分,注释最完整、测试最严谨
1
Sources
90%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
Related Entities
Related Claims
VerifiedClaude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率75% similarVerifiedClaude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先74% similarUnverifiedClaude Sonnet 3.7以扩展思维(Extended Thinking)能力著称,在SWE-bench编程基准测试上取得了当时的最高分74% similarUnverified在通用知识方面,Claude Sonnet以74比63的得分领先DeepSeek73% similarVerifiedClaude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13176API
curl https://kongchang.com/api/v1/knowledge/claims/13176MCP
get_claim(id=13176)