待验证80% 置信事实时间未知
ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%
1
来源数
80%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Gemini 3.5 Pro深度评测:多模态断层领先,9.2分旗舰实力全解析
bilibiliEA同学
涉及实体
相关事实
待验证人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间78% 相似待验证在ARC-AGI-3基准上,GPT-5.6 Sol得分8%,其他模型普遍不足2%,Anthropic因成本过高未运行Fable73% 相似待验证自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上71% 相似待验证2023年人类在GAIA测试中的平均成功率约为90%,而当时最强的GPT-4在Level 1上仅勉强达到15%68% 相似待验证ARC-AGI-1 在2024年之前,最先进的AI系统正确率长期徘徊在30%左右,远低于人类的85%以上67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13611API
curl https://kongchang.com/api/v1/knowledge/claims/13611MCP
get_claim(id=13611)