Unverified50% confidenceBenchmarkExact time
在专为模型设计的未知规则小游戏测试中,GPT-6拿到99分接近满分,人类最高分只有30多分,其他模型仅在40分左右
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/21/2026
First Seen
Valid until: 12/20/2026
Sources
Related Entities
Related Claims
UnverifiedGPT-6 Astra在ARC-AGI类测试中达到接近满分的99.9%,而普通人类测试者平均得分仅为48%74% similarUnverified即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%71% similarUnverified在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象69% similarUnverifiedGPT-4作为裁判时与人类评价的一致性可超过80%,但存在位置偏差、冗长偏差和自我偏好等系统性问题68% similarUnverified在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/938912API
curl https://kongchang.com/api/v1/knowledge/claims/938912MCP
get_claim(id=938912)