Unverified50% confidenceBenchmarkExact time
在CyberGym网络安全测试中GPT-5.6以84.5%反超Claude的83.8%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/14/2026
First Seen
Valid until: 10/12/2026
Sources
GPT-5.6发布:三款模型对标Claude,ChatGPT Work超级应用全解析
bilibiliAI-seeker7/9/2026
Related Claims
UnverifiedGPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 584% similarUnverifiedGPT-5.6在网络安全基准上:ExploitBench二代73.5%(上一代47.9%),ExploitGym两小时限制峰值通过率从15.1%提升至24.9%(6小时可达33.7%),CyberSecBench Pro 71.2%(上一代45.8%)76% similarUnverifiedGPT-5.6 Sol在ExploitBench网络安全基准上从GPT-5.5的40%跃升至73.5%74% similarUnverified在DeepSWE基准测试中,GPT 5.5以约70%的通过率高居榜首,比Opus 4.7领先超过15个百分点72% similarUnverified官方安全卡将GPT-5.6的生物化学与网络安全能力评为High71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/504393API
curl https://kongchang.com/api/v1/knowledge/claims/504393MCP
get_claim(id=504393)