待验证50% 置信事实精确时间
在Diamond子集中,Claude 3.0 Opus得分5.2%,Gemini 1.5 Pro得分4.7%,GPT-4o Mini得分4.6%,Kimi K2.6得分3.8%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)81% 相似待验证在Diamond子集中,GPT-4o得分6.3%,通过率7.2%79% 相似部分验证Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%76% 相似待验证据非官方爆料,Terminal Bench 3.0基准测试中Claude Opus 5 Max以43.5%的得分超越GPT-5.6-Sol的34.6%重登榜首74% 相似待验证在GPQA Diamond(博士级推理)测评中,Claude Opus 4.7以94.2%夺冠,DeepSeek V4 Pro以90.1%拿下开源第一73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/48343API
curl https://kongchang.com/api/v1/knowledge/claims/48343MCP
get_claim(id=48343)