待验证50% 置信基准精确时间
官方安全卡将GPT-5.6的AI自我改进能力评为低于High
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/11
首次发现
有效期至:2026/10/9
来源
GPT-5.6 Sol有限预览,AI能力扩张背后的安全边界
bilibili江枫渔火AI2026/7/9
相关事实
待验证GPT-5.5在Databricks的Agent Harness设置下相比GPT-5.4实现了46%的错误率降低76% 相似待验证GPT-5.6的网络安全评测是在降低防护的条件下运行的,评测分数反映模型能力上限而非日常可用水平76% 相似待验证在OpenAI内部基准中,GPT-5.6 Sol在递归自我改进(模型改进任务)上领先GPT-5.5约16分,AI基础设施优化(芯片设计流程)较5.5提升31%72% 相似待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 572% 相似待验证OpenAI选择公开发布了GPT 5.5不太好看的安全数据,包括对抗性攻击下拒绝率下降的信息71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/487534API
curl https://kongchang.com/api/v1/knowledge/claims/487534MCP
get_claim(id=487534)