待验证80% 置信事实时间未知
在GPQA Diamond(博士级推理)测评中,Claude Opus 4.7以94.2%夺冠,DeepSeek V4 Pro以90.1%拿下开源第一
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
DeepSeek V4 Pro深度评测:对比8款旗舰模型谁更值得用
bilibili磊哥哥哈哈哈哈
涉及实体
相关事实
待验证Claude Opus 4.8 reached 85.9% on the GraphWalks 256K subset (up from 76.9% for 4.7) and 68.1% on the full 1-million-token version, nearly double Opus 4.7's score of 40.3%74% 相似待验证在Diamond子集中,Claude 3.0 Opus得分5.2%,Gemini 1.5 Pro得分4.7%,GPT-4o Mini得分4.6%,Kimi K2.6得分3.8%73% 相似待验证Claude Opus 4.8在智能体实战跑分中拿下1890分,比上一代高出137分,甩开GPT 5.5达121分72% 相似部分验证Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%71% 相似待验证Opus 4在SWE-bench Verified上的通过率超过72%,显著领先于其他竞争模型69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/10498API
curl https://kongchang.com/api/v1/knowledge/claims/10498MCP
get_claim(id=10498)