待验证50% 置信基准精确时间
在CyberGym网络安全测试中GPT-5.6以84.5%反超Claude的83.8%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/14
首次发现
有效期至:2026/10/12
来源
GPT-5.6发布:三款模型对标Claude,ChatGPT Work超级应用全解析
bilibiliAI-seeker2026/7/9
相关事实
待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 584% 相似待验证GPT-5.6在网络安全基准上:ExploitBench二代73.5%(上一代47.9%),ExploitGym两小时限制峰值通过率从15.1%提升至24.9%(6小时可达33.7%),CyberSecBench Pro 71.2%(上一代45.8%)76% 相似待验证GPT-5.6 Sol在ExploitBench网络安全基准上从GPT-5.5的40%跃升至73.5%74% 相似待验证在DeepSWE基准测试中,GPT 5.5以约70%的通过率高居榜首,比Opus 4.7领先超过15个百分点72% 相似待验证官方安全卡将GPT-5.6的生物化学与网络安全能力评为High71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/504393API
curl https://kongchang.com/api/v1/knowledge/claims/504393MCP
get_claim(id=504393)