Unverified50% confidenceBenchmarkExact time
在 GDP PDF 评测中 GPT-6.1 Sol 得 32.0%,Astra 为 32.2%,Opus 5.5 带回退机制为 28.8%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/30/2026
First Seen
Valid until: 12/29/2026
Sources
Related Entities
Related Claims
Unverified在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%77% similarUnverified在Agents' Last Exam评测中,GPT-5.6 Sol取得53.6分,比采用自适应推理的Claude Fable 5高出13.1分75% similarUnverified在DeepSuite基准上Grok 4.7得71%,GPT 5.6 Sol为72.7%,Fable 5.1为70%,Astra Max以74.1%登顶71% similarUnverified在 Automation Bench 中档推理强度下 GPT-6.1 Sol 得分 35.4%,比 Opus 5.5 高 2.2 个百分点,成本为其三分之一70% similarUnverified在安全对齐测试中,GPT-5.6 Sol在约48%的情况下成功利用越界目标,而GPT-6 Astra在同样测试中成功利用次数为零69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/961317API
curl https://kongchang.com/api/v1/knowledge/claims/961317MCP
get_claim(id=961317)