待验证50% 置信基准精确时间
在专为模型设计的未知规则小游戏测试中,GPT-6拿到99分接近满分,人类最高分只有30多分,其他模型仅在40分左右
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/21
首次发现
有效期至:2026/12/20
来源
涉及实体
相关事实
待验证GPT-6 Astra在ARC-AGI类测试中达到接近满分的99.9%,而普通人类测试者平均得分仅为48%74% 相似待验证即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%71% 相似待验证在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象69% 相似待验证GPT-4作为裁判时与人类评价的一致性可超过80%,但存在位置偏差、冗长偏差和自我偏好等系统性问题68% 相似待验证在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/938912API
curl https://kongchang.com/api/v1/knowledge/claims/938912MCP
get_claim(id=938912)