待验证75% 置信事实时间未知
GLM-4.7在代码能力基准测试中超过DeepSeek V3.2及Claude Sonnet 4.5
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
GLM-4.7深度实测:编程能力全面对标Claude Sonnet 4.5
bilibiliAI超元域
涉及实体
相关事实
待验证国产模型中编程能力最强的GLM 5.1,实测水平大致处于Claude Opus 4.5和Sonnet 4.6之间77% 相似待验证GLM 4.6在HumanEval、MBPP、SWE-bench等代码评测基准以及MMLU、GPQA等综合能力基准上的表现对齐Claude 3.4和Claude 3.4.577% 相似待验证GLM 5.2 在前端生成质量上优于 Claude Sonnet 575% 相似待验证GLM4的智能水平足以媲美Claude 3.5 Sonnet等主流商业闭源大模型,且使用成本更低73% 相似待验证根据Anthropic发布的基准测试数据,Sonnet 4.5在编码能力上略优于Claude Opus 4.172% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/24229API
curl https://kongchang.com/api/v1/knowledge/claims/24229MCP
get_claim(id=24229)