待验证50% 置信事实精确时间
本次评测采用六道覆盖前端、推理、因果的复合题目,让 V4.1 Flash、V4 Flash、开启深度思考的 V4 Pro 和 JLM 5.3 Flash 四款模型同题背对背测试
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/9/11
首次发现
有效期至:2026/9/25
来源
涉及实体
相关事实
待验证在立方体展开与三维折叠题中,V4.1 Flash 和 V4 Flash 均白屏失败,V4 Pro 展开图正确但闭合逻辑错误判定失败,JLM 5.3 Flash 表现最佳75% 相似待验证在矢量设计工具与状态机逻辑题中,四款模型全部通关,V4.1 Flash 在此题表现最稳、UI 工业质感最佳73% 相似待验证DeepSeek-Reasonix提供两个基础模型选项:V3 Flash和V3 Pro,并配有五个推理强度级别72% 相似待验证经过修复后DeepSeek V4 Flash可以直接与旗舰模型竞争68% 相似已验证DeepSeek将实验性多模态模型V4-Flash-Vision-EXP上线API平台,其文本能力与V4 Flash持平,多模态智能体基准测试性能接近Opus 4.8水平67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/900421API
curl https://kongchang.com/api/v1/knowledge/claims/900421MCP
get_claim(id=900421)