待验证50% 置信基准精确时间
单轮测试排名靠前的是GLM-5.3得分96.2%、Kimi 93.9%、GLM-Flash 92.2%,三者原始分都是79/84
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/22
首次发现
有效期至:2026/12/21
来源
涉及实体
相关事实
待验证GLM 5.2在Terminal Bench测试中得分81分,GLM 5.1得分63.5分,GPT 5.5得分84分,Opus 4.8得分85分80% 相似待验证智谱GLM(5.3)在测试中打分约85分,在反转与主线设计上表现成为本场亮点74% 相似待验证在贴吧小站项目评测中,Sol以83.95分居首,GLM 5.2以76.59分位列第二,Terra 75.97分排第三,Luna 68.56分排第四74% 相似待验证GLM 5.2在Frontier SW基准测试中得分为74.4%,接近Anthropic Opus 4.8的水平73% 相似待验证在测评中Qwen 3 Max领先Kimi K3(77.5%)、GLM(75%)和GPT-4系列(71.25%)73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/941211API
curl https://kongchang.com/api/v1/knowledge/claims/941211MCP
get_claim(id=941211)