待验证50% 置信基准精确时间
此前GPT-4等顶级模型在ARC-AGI上的得分长期徘徊在个位数至30分区间
1
来源数
50%
置信度
长期有效
时效性
2026/9/21
首次发现
来源
涉及实体
相关事实
待验证在ARC-AGI-3基准上,同一个GPT-5.6模型仅更换Codex Harness两个配置项,得分从13.3%提升到38.3%,输出token降低六倍71% 相似待验证表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.91770% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%70% 相似待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%68% 相似待验证Opus 5在ARC-AGI 3上的得分是次优模型的三倍68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/938885API
curl https://kongchang.com/api/v1/knowledge/claims/938885MCP
get_claim(id=938885)