待验证50% 置信基准精确时间
在HLE基准测试中,COMED将GPT-5.5的表现从23.1%提升到28.1%
1
来源数
50%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%76% 相似待验证GPT-5.6在Agent's Last Exam测试中以53.6分创下历史新高,领先Claude Opus 4.5达13.1分72% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%72% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%72% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/946138API
curl https://kongchang.com/api/v1/knowledge/claims/946138MCP
get_claim(id=946138)