Unverified50% confidenceBenchmarkExact time
在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/13/2026
First Seen
Valid until: 10/11/2026
Sources
GPT-5.6发布:三款模型对标Claude,ChatGPT Work超级应用全解析
bilibiliAI-seeker7/9/2026
Related Claims
UnverifiedGPT 5.2在前沿科学基准的竞赛题中得分约77%,但在开放式研究任务中表现下降到约25%73% similarUnverified在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象72% similarUnverified用 Opus 5 在 Medium 设置下配合 Ponytail 运行基准测试,输出 Token 明显减少,成本实际便宜约 22%72% similarUnverified通过一系列策略调整,Opus 5 的使用成本最多可降低 80%,且在部分基准测试中仍能跑赢 Opus 4.872% similarUnverifiedClaude Opus 4.8's most significant advancement is a dramatically lower error rate during actual use rather than improved benchmark scores71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/501554API
curl https://kongchang.com/api/v1/knowledge/claims/501554MCP
get_claim(id=501554)