待验证95% 置信事实时间未知
测试的四个AI模型分别是Claude Opus 4.5、Gemini 3 Pro、GLM 4.7和Minimax M2.1
1
来源数
95%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
前端UI生成实测:GLM 4.7、Claude Opus、Gemini、Minimax谁最强?
bilibiliGoldenSpiderAI
涉及实体
相关事实
待验证Opus 4在软件工程基准测试中击败了包括Gemini 2.5 Pro在内的所有模型75% 相似待验证MiMo V2.5 Pro在SWE Bench Pro、GDP EVOL、CLAW EVOL等基准测试中与GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro竞争74% 相似待验证Gemini 2.5 Pro在数学能力基准测试中与O3 Mini持平,两者都将其他模型远远甩在身后72% 相似待验证评测使用了Claude 4.0、Claude 3.7和Gemini Pro 2.5 0506三个大模型作为底层引擎72% 相似待验证Grok 4.2、Claude Opus 4.7、Gemini 3.1 Pro等模型在密集更新71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/20492API
curl https://kongchang.com/api/v1/knowledge/claims/20492MCP
get_claim(id=20492)