待验证90% 置信事实时间未知
在困难题中,Claude Sonnet 4.6拿下全场最高93分,注释最完整、测试最严谨
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
涉及实体
相关事实
已验证Claude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率75% 相似已验证Claude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先74% 相似待验证Claude Sonnet 3.7以扩展思维(Extended Thinking)能力著称,在SWE-bench编程基准测试上取得了当时的最高分74% 相似待验证在通用知识方面,Claude Sonnet以74比63的得分领先DeepSeek73% 相似已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13176API
curl https://kongchang.com/api/v1/knowledge/claims/13176MCP
get_claim(id=13176)