已验证65% 置信基准精确时间
在DeepSuite基准上Grok 4.7得71%,GPT 5.6 Sol为72.7%,Fable 5.1为70%,Astra Max以74.1%登顶
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/9/25
首次发现
有效期至:2026/12/24
来源
涉及实体
相关事实
已验证在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分78% 相似待验证GPT-6 Astra在Frontier Math Tier 4上峰值达到98%,在不开启推理、不使用思维链的情况下仍达到83%76% 相似待验证在Artificial Analysis的Omniscience幻觉指标上,GPT-5.6 Sol Max高达89%,高于Claude Fable的55%和GLM 5.2的28%75% 相似待验证在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%74% 相似待验证在谷歌公布的图表中,Argon的Deep SWE得分接近78%,而Claude Opus 5.5和GPT-6 Astra仅略高于74%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/949437API
curl https://kongchang.com/api/v1/knowledge/claims/949437MCP
get_claim(id=949437)