待验证50% 置信基准精确时间
GPT-5.6在SWE-bench评测中以不到竞品一半的成本实现更优效果和更高解决率
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/25
首次发现
有效期至:2026/10/23
来源
OpenAI发布GPT-5.6与ChatGPT Work:AI自主工作时代来临
bilibili皮皮蟹勇闯天涯2026/7/11
相关事实
待验证GPT-5.6在Terminal Bench、BrowseComp、Agent's Last Exam等测试中达到业界最优,在DeepSuite评测上以不到竞品一半的成本实现更优表现84% 相似待验证GPT-5.6 更新的核心是性价比,在保持或提升性能的同时压低推理成本与响应时间80% 相似待验证GPT-5.6 SOUL版本多项测试表现优于对标模型Fable 5,定价更具竞争力79% 相似待验证皮皮在Cursor中选用GPT-4.5模型,理由是Token消耗较少且能实现目标效果,性价比较高79% 相似待验证早期GPT-4在SWE-bench上的解决率不足2%,而近期顶尖模型已突破50%79% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/614312API
curl https://kongchang.com/api/v1/knowledge/claims/614312MCP
get_claim(id=614312)