Unverified80% confidenceFactTime unknown
Opus 4在软件工程基准测试中击败了包括Gemini 2.5 Pro在内的所有模型
1
Sources
80%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
Claude 4实测:Opus 4与Sonnet 4深度评测对比
bilibili智译工坊
Related Entities
Related Claims
Unverified测试的四个AI模型分别是Claude Opus 4.5、Gemini 3 Pro、GLM 4.7和Minimax M2.175% similarVerifiedClaude Opus 4.5在ARC-AGI-V2测试中以超过6个百分点的优势领先Gemini 3 Pro74% similarUnverified在研究生级推理和Agent工具使用基准测试中,Opus 4基本处于领先地位,但Gemini 2.5 Pro在部分项目上与之非常接近72% similarUnverified最新版Gemini在几乎所有基准测试中都击败了旧版Claude,唯独编程这一项例外70% similarUnverified本文测试将Gemini 3.1 Pro与Claude Opus 4.6、GPT 5.3 Codex进行横向对比68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18600API
curl https://kongchang.com/api/v1/knowledge/claims/18600MCP
get_claim(id=18600)