待验证60% 置信事实时间未知
GLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品
1
来源数
60%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
国产AI编程套餐横评:7大模型怎么选最划算
bilibiliAI全文总结
涉及实体
相关事实
待验证GLM 5.2是一个开源高性能模型,据称能达到接近甚至超越Opus 4.8的效果,价格却只有六分之一73% 相似待验证在HumanEval等专业代码基准测试中,顶尖模型的表现已接近甚至超越人类平均水平72% 相似待验证根据智谱公布的评测数据,GLM 5.2在多个基准上仅落后于Anthropic的Claude 4.8和OpenAI的部分顶级模型,稳居行业第二梯队68% 相似待验证斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%67% 相似待验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13490API
curl https://kongchang.com/api/v1/knowledge/claims/13490MCP
get_claim(id=13490)