待验证50% 置信基准精确时间
在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/8/23
首次发现
有效期至:2026/9/6
来源
涉及实体
相关事实
待验证在ARC-AGI-3基准上,GPT-5.6 Sol得分8%,其他模型普遍不足2%,Anthropic因成本过高未运行Fable76% 相似待验证人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间66% 相似待验证Devin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%65% 相似待验证ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%64% 相似待验证风险降低类AI用例虽然只占3.4%,但其中有25%报告了变革性ROI64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/791486API
curl https://kongchang.com/api/v1/knowledge/claims/791486MCP
get_claim(id=791486)