待验证60% 置信基准精确时间
旗舰Soul在Terminal Bench 2.1基准上取得91.9%的成绩
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/8
首次发现
有效期至:2026/10/6
来源
GPT-5.6编程基准91.9%:三档模型选择与Ultra模式避坑指南
bilibili费曼学AI2026/6/28
相关事实
待验证Soul标准模式得分88.8%,开启Ultra后跃升至91.9%,比Max模式多涨2.7个百分点70% 相似待验证通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分66% 相似待验证官方公布Nex-N2 Pro的SWE Bench Pro得分为58.8分,Terminal Bench得分75.3分64% 相似待验证在Terminal Bench 2.1基准测试上,GPT-5.6 Sol的Ultra模式接近92%,超越竞品的88%表现63% 相似待验证在Terminal Bench 2.1上Sol Ultra模式接近92%,超过Mythos 5的88%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/230616API
curl https://kongchang.com/api/v1/knowledge/claims/230616MCP
get_claim(id=230616)