待验证50% 置信观点精确时间
在国内主流大模型编程能力测试中,智谱GLM排名第一,DeepSeek、Kimi、MiniMax位于第二梯队,阿里通义、腾讯混元表现略逊
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Codex与Claude Code双引擎:AI工程化编程实战解析
bilibili图灵课堂VIP2026/6/19
相关事实
待验证在国内大模型中,GAM(千问)综合能力排名第一梯队,MINIMAX、Kimi、DeepSeek为第二梯队80% 相似已验证国内大模型实测中,智谱GLM综合能力排名第一梯队,DeepSeek被评为性价比之选71% 相似待验证字节跳动的豆包(Doubao)系列模型、阿里的通义千问(Qwen)、深度求索的DeepSeek-Coder等国产大模型在HumanEval、MBPP等代码基准测试上已接近甚至达到国际一线水平69% 相似待验证作者建议在复杂代码根因分析任务上谨慎使用 MiniMax M3、DeepSeek 等模型69% 相似待验证国产大模型的主要竞争者包括阿里云的Qwen系列、深度求索的DeepSeek系列、百度的文心系列以及月之暗面的Kimi68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/44634API
curl https://kongchang.com/api/v1/knowledge/claims/44634MCP
get_claim(id=44634)