待验证50% 置信基准精确时间
在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/12
首次发现
有效期至:2026/10/10
来源
GPT-5.6发布:旗舰模型Sol亲自训练小模型,AI递归自我改进成真
bilibili小牛AI_XNAI2026/7/10
相关事实
待验证在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半72% 相似待验证GPT 5.2在前沿科学基准的竞赛题中得分约77%,但在开放式研究任务中表现下降到约25%70% 相似待验证GPT模型在回忆能力单独测试中表现糟糕,在空间信息、转录内容、物理实验等所有类别上仅约50%事实被正确回忆,开源模型更差69% 相似待验证GPT-5.4相对于GPT-5.2,单独声明出错的概率降低了33%,整个回复包含任何错误的概率降低了18%69% 相似待验证模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/491643API
curl https://kongchang.com/api/v1/knowledge/claims/491643MCP
get_claim(id=491643)