待验证90% 置信事实时间未知
在简单题中,GLM 5.1补了19行测试,Kimi K2.6补了12行,其他五个模型(包括Sonnet 4.6)一行测试都没写
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
涉及实体
相关事实
待验证在普通题(MCP协议客户端Signal转发)中,GLM 5.1写了108行测试,是Sonnet的1.3倍,Kimi的2倍75% 相似待验证GLM4在World of AI基准测试工具中排名第五67% 相似待验证国产模型中编程能力最强的GLM 5.1,实测水平大致处于Claude Opus 4.5和Sonnet 4.6之间67% 相似待验证GLM-4.7在代码能力基准测试中超过DeepSeek V3.2及Claude Sonnet 4.567% 相似待验证在图片隐藏虫子识别测试中,Sonnet 5的Max模式花费约10分钟并识别结果完全正确,而Gemini顶配模型只找到4只,GPT-5.5 X-High未能检测出66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13174API
curl https://kongchang.com/api/v1/knowledge/claims/13174MCP
get_claim(id=13174)