待验证80% 置信事实时间未知
Opus 4在软件工程基准测试中击败了包括Gemini 2.5 Pro在内的所有模型
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Claude 4实测:Opus 4与Sonnet 4深度评测对比
bilibili智译工坊
涉及实体
相关事实
待验证测试的四个AI模型分别是Claude Opus 4.5、Gemini 3 Pro、GLM 4.7和Minimax M2.175% 相似已验证Claude Opus 4.5在ARC-AGI-V2测试中以超过6个百分点的优势领先Gemini 3 Pro74% 相似待验证在研究生级推理和Agent工具使用基准测试中,Opus 4基本处于领先地位,但Gemini 2.5 Pro在部分项目上与之非常接近72% 相似待验证最新版Gemini在几乎所有基准测试中都击败了旧版Claude,唯独编程这一项例外70% 相似待验证本文测试将Gemini 3.1 Pro与Claude Opus 4.6、GPT 5.3 Codex进行横向对比68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18600API
curl https://kongchang.com/api/v1/knowledge/claims/18600MCP
get_claim(id=18600)