Unverified50% confidenceBenchmarkExact time
GPT-5.6 Sol在OSWorld 2.0计算机操作基准上达到62.6%,超越Opus 4.8,同时输出Token减少85%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/11/2026
First Seen
Valid until: 10/9/2026
Sources
GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析
bilibilikate人不错7/10/2026
Related Claims
VerifiedSOL的基准分数几乎是上一代GPT-5.5的两倍,实现了代际跃升,但整体仍落后于Fable 581% similarUnverifiedGPT-5.6 Sol在BrowseComp浏览任务基准上达到92.2%80% similarUnverifiedGPT-5.6 Sol在ARC-AGI-2上取得92.5%的成绩79% similarPartially Verified在同等任务上,GPT-5.5使用的输出token比Opus少约72%77% similarUnverifiedGPT-5.6 Sol在ExploitBench网络安全基准上从GPT-5.5的40%跃升至73.5%77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/484710API
curl https://kongchang.com/api/v1/knowledge/claims/484710MCP
get_claim(id=484710)