Unverified50% confidenceBenchmarkExact time
在96%的关卡里,GPT-6找到答案所需的尝试次数比普通人还少
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/26/2026
First Seen
Valid until: 12/25/2026
Sources
Related Entities
Related Claims
Unverified在专为模型设计的未知规则小游戏测试中,GPT-6拿到99分接近满分,人类最高分只有30多分,其他模型仅在40分左右77% similarUnverified即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%73% similarUnverified在无说明书、无规则的陌生游戏测试中,上一代AI取得7.8%成绩,GPT-6在保留推理状态的Agent框架下达到99.9%71% similarUnverified在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象69% similarUnverified在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/951508API
curl https://kongchang.com/api/v1/knowledge/claims/951508MCP
get_claim(id=951508)