Unverified50% confidenceBenchmarkExact time
GPT-5.6 Sol在ExploitBench网络安全基准上从GPT-5.5的40%跃升至73.5%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/11/2026
First Seen
Valid until: 10/9/2026
Sources
GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析
bilibilikate人不错7/10/2026
Related Claims
UnverifiedGPT-5.6在网络安全基准上:ExploitBench二代73.5%(上一代47.9%),ExploitGym两小时限制峰值通过率从15.1%提升至24.9%(6小时可达33.7%),CyberSecBench Pro 71.2%(上一代45.8%)81% similarUnverifiedGPT-5.6 Sol在BrowseComp浏览任务基准上达到92.2%81% similarUnverifiedGPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 580% similarVerifiedSOL的基准分数几乎是上一代GPT-5.5的两倍,实现了代际跃升,但整体仍落后于Fable 579% similarUnverified在OpenAI内部基准中,GPT-5.6 Sol在递归自我改进(模型改进任务)上领先GPT-5.5约16分,AI基础设施优化(芯片设计流程)较5.5提升31%77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/484711API
curl https://kongchang.com/api/v1/knowledge/claims/484711MCP
get_claim(id=484711)