待验证50% 置信基准精确时间
在CAD World的200个任务测试中,最强的GPT-5.4成功率仅有17.5%
1
来源数
50%
置信度
长期有效
时效性
2026/9/26
首次发现
来源
涉及实体
相关事实
待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%78% 相似待验证在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.874% 相似待验证在HLE基准测试中,COMED将GPT-5.5的表现从23.1%提升到28.1%73% 相似待验证在长周期智能体工作流测试(Engines Last Exam)中,GPT-5.6 Sol 得分 53.6,比 Faber-5 高出 13.1 分73% 相似待验证在Agents' Last Exam评测中,GPT-5.6 Sol取得53.6分,比采用自适应推理的Claude Fable 5高出13.1分70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/951467API
curl https://kongchang.com/api/v1/knowledge/claims/951467MCP
get_claim(id=951467)