待验证60% 置信事实精确时间
GLM4在Design Arena排行榜上排名第一,得分约为1300分,超过Claude 3.5和Gemini 1.5 Pro
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
GLM4 Open-Source Flagship Tested: Crushes Claude and Other Commercial Models in Frontend Development
bilibiliAI-seeker2026/6/21
相关事实
待验证GLM 5.2 achieved approximately 1300 ELO points on the Design Arena leaderboard, surpassing Claude 3.5.72% 相似待验证Gemini 3.5 Pro在MMLU Pro基准测试中得分89.4分,领先GPT 5.5和Claude67% 相似待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)65% 相似待验证测试中GLM 5.1综合得分89.3分,排名第一,超过Claude Sonnet 4.6的87.2分64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/40538API
curl https://kongchang.com/api/v1/knowledge/claims/40538MCP
get_claim(id=40538)