待验证50% 置信基准精确时间
在ARC-AGI-3基准上,GPT-5.6 Sol得分8%,其他模型普遍不足2%,Anthropic因成本过高未运行Fable
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/12
首次发现
有效期至:2026/10/10
来源
GPT-5.6深度评测:性价比碾压竞品,但越狱安全漏洞不容忽视
bilibiliTOP高效学习法2026/7/10
相关事实
待验证ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%73% 相似待验证在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半71% 相似待验证免费额度充足但AI仅调用较弱模型(如GPT-3.5级)的产品,摘要质量明显低于付费版调用的旗舰模型,试用时需确认免费额度用的是否为同一模型70% 相似待验证人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间67% 相似待验证在Artificial Analysis编程智能体指数上,Sol开到最高推理档拿下80分,比Fable 5高2.8分,且使用输出Token不到一半、耗时不到一半、成本低约三分之一65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/491038API
curl https://kongchang.com/api/v1/knowledge/claims/491038MCP
get_claim(id=491038)