Unverified50% confidenceBenchmarkExact time
GPT-6 Astra在ARC-AGI类测试中达到接近满分的99.9%,而普通人类测试者平均得分仅为48%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/18/2026
First Seen
Valid until: 12/17/2026
Sources
Related Entities
Related Claims
UnverifiedARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%76% similarUnverified在ARC-AGI-3基准上,GPT-5.6 Sol得分8%,其他模型普遍不足2%,Anthropic因成本过高未运行Fable72% similarUnverifiedGPT-4作为裁判时与人类评价的一致性可超过80%,但存在位置偏差、冗长偏差和自我偏好等系统性问题68% similarUnverified2023年人类在GAIA测试中的平均成功率约为90%,而当时最强的GPT-4在Level 1上仅勉强达到15%65% similarUnverifiedGPT-4等大模型在Spider等基准测试上的零样本或少样本SQL生成准确率已超过80%64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/932462API
curl https://kongchang.com/api/v1/knowledge/claims/932462MCP
get_claim(id=932462)