Unverified50% confidenceBenchmarkExact time
在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
GPT-5.6发布:旗舰模型Sol亲自训练小模型,AI递归自我改进成真
bilibili小牛AI_XNAI7/10/2026
Related Claims
Unverified在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半72% similarUnverifiedGPT 5.2在前沿科学基准的竞赛题中得分约77%,但在开放式研究任务中表现下降到约25%70% similarUnverifiedGPT模型在回忆能力单独测试中表现糟糕,在空间信息、转录内容、物理实验等所有类别上仅约50%事实被正确回忆,开源模型更差69% similarUnverifiedGPT-5.4相对于GPT-5.2,单独声明出错的概率降低了33%,整个回复包含任何错误的概率降低了18%69% similarUnverified模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/491643API
curl https://kongchang.com/api/v1/knowledge/claims/491643MCP
get_claim(id=491643)