待验证60% 置信事实时间未知
Google Gemini在最新的数学推理和编程基准测试中已经超越了OpenAI O3、Claude 4和DeepSeek R1,稳居榜首
1
来源数
60%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Google AI Studio使用教程:Gemini实战指南从入门到精通
bilibili出海学长Ethan
涉及实体
相关事实
待验证Gemini 3在SWE-bench基准测试中智能体场景下的得分远超同类模型79% 相似待验证一位技术博主对Google的Gemini 3.1 Pro和Anthropic的Opus 4.6进行了为期两天的前端编程能力全方位测试77% 相似待验证五项基准测试综合结果为技术性平局,Claude 4.5在编程实战领先,Gemini 3 Pro在知识推理领先76% 相似待验证在研究生级推理和Agent工具使用基准测试中,Opus 4基本处于领先地位,但Gemini 2.5 Pro在部分项目上与之非常接近75% 相似待验证Qwen3.5-Omni多项关键指标超过Google的Gemini 3.1 Pro74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/23825API
curl https://kongchang.com/api/v1/knowledge/claims/23825MCP
get_claim(id=23825)