待验证50% 置信基准精确时间
GPT-5.6 Sol在ExploitBench网络安全基准上从GPT-5.5的40%跃升至73.5%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/11
首次发现
有效期至:2026/10/9
来源
GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析
bilibilikate人不错2026/7/10
相关事实
待验证GPT-5.6在网络安全基准上:ExploitBench二代73.5%(上一代47.9%),ExploitGym两小时限制峰值通过率从15.1%提升至24.9%(6小时可达33.7%),CyberSecBench Pro 71.2%(上一代45.8%)81% 相似待验证GPT-5.6 Sol在BrowseComp浏览任务基准上达到92.2%81% 相似待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 580% 相似已验证SOL的基准分数几乎是上一代GPT-5.5的两倍,实现了代际跃升,但整体仍落后于Fable 579% 相似待验证在OpenAI内部基准中,GPT-5.6 Sol在递归自我改进(模型改进任务)上领先GPT-5.5约16分,AI基础设施优化(芯片设计流程)较5.5提升31%77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/484711API
curl https://kongchang.com/api/v1/knowledge/claims/484711MCP
get_claim(id=484711)