待验证50% 置信事实精确时间
综合智能指数常见子基准包括 MMLU、HumanEval、MBPP、MATH、GSM8K、GPQA 和 LongBench
1
来源数
50%
置信度
长期有效
时效性
2026/9/22
首次发现
来源
涉及实体
相关事实
待验证DeepSpec配套九个评测基准,涵盖数学推理(GSM8K、MATH-500)、代码生成(HumanEval、MBPP、LiveCodeBench)和通用对话(MT-Bench、Alpaca、Arena-Hard v2)74% 相似待验证在国内主流大模型编程能力测试中,智谱GLM排名第一,DeepSeek、Kimi、MiniMax位于第二梯队,阿里通义、腾讯混元表现略逊64% 相似待验证教程推荐四个主流模型:Llama 3.1(Meta)综合能力最强,DeepSeek R1(深度求索)擅长深度思考推理,Qwen 3(阿里通义千问)中文效果最好,Gemma 3(谷歌)支持多模态63% 相似待验证Google DeepMind提出了AGI的六级分类框架,从Level 0到Level 5(超人级),当前最先进的大模型大致处于Level 1到Level 2的通用范围62% 相似待验证多Token预测(MTP)技术已被DeepSeek、Meta、谷歌采用,正成为大模型的标配能力62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/941568API
curl https://kongchang.com/api/v1/knowledge/claims/941568MCP
get_claim(id=941568)