Unverified90% confidenceFactTime unknown
OpenAI o4在ARC-AGI-2测试中得分68.8%,GPT-5.2得分52.9%
1
Sources
90%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
Gemini 3.1 Pro深度横评:ARC-AGI-2得分77.1%,真的最强吗?
bilibili锋芒AI
Related Entities
Related Claims
Unverified在Terminal Bench 2.0基准测试中,OpenAI 4.6得分为58%,GPT 5.4得分为75.1%71% similarUnverifiedo3模型在2024年12月的ARC-AGI测试中达到87.5%,同期在Codeforces的评分达到2727(超越99.95%的人类参赛者)70% similarUnverifiedFable 5在SWE Bench Pro编程测试上得分80.3分,而OpenAI的GPT 5.5仅为58.6分69% similarUnverifiedOpus 5在ARC-AGI 3上的得分是次优模型的三倍65% similarUnverifiedCodex One在SWE-bench上的表现略优于O3 High,在OpenAI内部软件工程任务上准确率达到75%,而O3 High为70%65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/12518API
curl https://kongchang.com/api/v1/knowledge/claims/12518MCP
get_claim(id=12518)