Verified65% confidenceBenchmarkExact time
在DeepSuite基准上Grok 4.7得71%,GPT 5.6 Sol为72.7%,Fable 5.1为70%,Astra Max以74.1%登顶
3
Sources
65%
Confidence
Medium-term (~90 days)
Relevance
9/25/2026
First Seen
Valid until: 12/24/2026
Sources
Related Entities
Related Claims
Verified在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分78% similarUnverifiedGPT-6 Astra在Frontier Math Tier 4上峰值达到98%,在不开启推理、不使用思维链的情况下仍达到83%76% similarUnverified在Artificial Analysis的Omniscience幻觉指标上,GPT-5.6 Sol Max高达89%,高于Claude Fable的55%和GLM 5.2的28%75% similarUnverified在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%74% similarUnverified在谷歌公布的图表中,Argon的Deep SWE得分接近78%,而Claude Opus 5.5和GPT-6 Astra仅略高于74%73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/949437API
curl https://kongchang.com/api/v1/knowledge/claims/949437MCP
get_claim(id=949437)