Unverified50% confidenceBenchmarkExact time
在270位跨学科专家参与的真实工作流盲测中,混元模型以2.67/4的评分优于GLM系列的2.51/4
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/8/2026
First Seen
Valid until: 10/6/2026
Sources
GPT旗舰模型集成Codex:750 Token/秒推理速度详解
bilibili声译看世界7/7/2026
Related Claims
Unverified根据智谱公布的评测数据,GLM 5.2在多个基准上仅落后于Anthropic的Claude 4.8和OpenAI的部分顶级模型,稳居行业第二梯队66% similarUnverified模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距65% similarUnverifiedSchmidt & Hunter (1998)的元分析研究发现一般认知能力测试的预测效度为r=0.51,工作样本测试达到r=0.5463% similarUnverifiedGLM 4.6相较于GLM 4.5,代码能力提升27%,token消耗降低30%62% similarUnverifiedGLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/291495API
curl https://kongchang.com/api/v1/knowledge/claims/291495MCP
get_claim(id=291495)