待验证50% 置信事实精确时间
DeepSeek V4 Pro在Humanity's Last Exam基准测试中得分37.7
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
DeepSeek V4 Pro深度评测:性能媲美GPT-5.5,成本仅1/12
bilibili63号炼金工坊2026/6/18
相关事实
待验证DeepSeek V4 Pro在CodeForces取得3206分,MMT-266评测达到95.2%通过率68% 相似待验证OmniMerge V4在HumanEval测试中得分84.76,与Q6K原版持平67% 相似待验证GLM-4.7在代码能力基准测试中超过DeepSeek V3.2及Claude Sonnet 4.565% 相似待验证DeepSeek V4 Pro相比Qwen3.6 27B Q4领先约6%,如果不是在推理数学项上意外翻车,领先幅度可能超过10%64% 相似待验证QwQ-32B在多项主流基准测试中与DeepSeek R1满血版表现几乎持平,部分任务上实现了反超64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/44835API
curl https://kongchang.com/api/v1/knowledge/claims/44835MCP
get_claim(id=44835)