待验证85% 置信事实时间未知
Gemini 3.5 Pro在MMLU Pro基准测试中得分89.4分,领先GPT 5.5和Claude
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Gemini 3.5 Pro深度评测:多模态断层领先,9.2分旗舰实力全解析
bilibiliEA同学
涉及实体
相关事实
待验证M2.7在SWE-bench Pro基准测试中得分56.22%,超过了Gemini 3.1 Pro79% 相似已验证Gemini 3.1 Pro在高级推理基准测试中达到77%,而Claude Opus 4.6为68%78% 相似待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)76% 相似待验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13606API
curl https://kongchang.com/api/v1/knowledge/claims/13606MCP
get_claim(id=13606)