Unverified60% confidenceFactTime unknown
顶级PhD专家在Troubleshooting Bench上的得分约为36%,GPT 5.5即时版的得分仅略低于此
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
GPT 5.5即时版深度解析:幻觉率腰斩背后的能力与安全博弈
bilibili英文白斑马
Related Entities
Related Claims
UnverifiedTerminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平75% similarUnverifiedFable 5在SWE Bench Pro编程测试上得分80.3分,而OpenAI的GPT 5.5仅为58.6分69% similarUnverifiedGLM 5.2在Post Train Bench测试中得分34.3分,领先GPT的28.4分,但落后于Opus的37.2分69% similarUnverified在Agent's Last Exam基准测试中,GPT-5.6 Soul(extra high档)得分近54%,Fable(max档)为45%69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/3401API
curl https://kongchang.com/api/v1/knowledge/claims/3401MCP
get_claim(id=3401)