待验证90% 置信事实时间未知
在普通题(MCP协议客户端Signal转发)中,GLM 5.1写了108行测试,是Sonnet的1.3倍,Kimi的2倍
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
涉及实体
相关事实
待验证在简单题中,GLM 5.1补了19行测试,Kimi K2.6补了12行,其他五个模型(包括Sonnet 4.6)一行测试都没写75% 相似待验证上一代Sonnet 4.5在OS World Verified基准测试中得分61.4%71% 相似待验证Sonnet 5 性能大致相当于 GLM 5.2 high 水平,但价格约为后者的三倍,并拥有 GLM 5.2 不具备的修订能力67% 相似待验证Sonnet 4.6在OS World Verified基准测试中得分72.5%66% 相似待验证在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13175API
curl https://kongchang.com/api/v1/knowledge/claims/13175MCP
get_claim(id=13175)