待验证50% 置信基准精确时间
在相同测试任务中,DeepSeek V4 Pro预览版耗时约5分30秒但未能成功修复Bug
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/9/5
首次发现
有效期至:2026/9/19
来源
涉及实体
相关事实
待验证DeepSeek V4 Pro在Humanity's Last Exam基准测试中得分37.769% 相似待验证DeepSeek-V3发布时在多项基准测试中与Claude 3.5 Sonnet持平甚至超越,训练成本据报道仅为主流闭源模型的数分之一61% 相似待验证在Claude Code环境中使用V4 Pro配合Thinking推理模式进行T5测试,耗时约6分48秒,生成的页面存在元素脚部出现在左上角的位置错乱Bug60% 相似待验证根据Commander Code官方内部评测数据,DeepSeek V4 Pro在高难度工具依赖任务中10次有6次击败了Claude Opus60% 相似待验证在Agent's Last Exam、ZeroBench、DeepSWE三项测试中,V4-Flash-Vision-Exp成绩反超Opus 4.859% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/858917API
curl https://kongchang.com/api/v1/knowledge/claims/858917MCP
get_claim(id=858917)