待验证50% 置信基准精确时间
在270位跨学科专家参与的真实工作流盲测中,混元模型以2.67/4的评分优于GLM系列的2.51/4
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/8
首次发现
有效期至:2026/10/6
来源
GPT旗舰模型集成Codex:750 Token/秒推理速度详解
bilibili声译看世界2026/7/7
相关事实
待验证根据智谱公布的评测数据,GLM 5.2在多个基准上仅落后于Anthropic的Claude 4.8和OpenAI的部分顶级模型,稳居行业第二梯队66% 相似待验证模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距65% 相似待验证Schmidt & Hunter (1998)的元分析研究发现一般认知能力测试的预测效度为r=0.51,工作样本测试达到r=0.5463% 相似待验证GLM 4.6相较于GLM 4.5,代码能力提升27%,token消耗降低30%62% 相似待验证GLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/291495API
curl https://kongchang.com/api/v1/knowledge/claims/291495MCP
get_claim(id=291495)