实测DeepSeek V4.1 Flash:六道题背对背横评四款模型

六题横评显示DeepSeek V4.1 Flash内测版仅得3分,JLM 5.3 Flash与V4 Pro并列领跑。
本文对DeepSeek V4.1 Flash限时内测版进行了六题横向评测,对比对象包括V4 Flash、开启深度思考的V4 Pro及JLM 5.3 Flash。六道题覆盖物理模拟、3D几何、状态机逻辑、约束推理、时间轴容错与辛普森悖论因果推断。结果显示:JLM 5.3 Flash与V4 Pro均以5分并列第一,V4 Flash得4分,而主角V4.1 Flash仅得3分——在物理模拟和3D几何两题中出现严重失误,但在矢量工具、时间轴和因果推断等题目上表现正常。作者特别指出,V4.1 Flash距最终形态仍有较大距离,本次结果仅供参考而非最终定论。
一次限时开放的内测:V4.1 Flash 悄然登场
DeepSeek 近期悄悄放出了一个可试用的 V4.1 Flash 版本,接口 ID 里直接写着过期日期——9 月 10 号。官方在内测群里放话,想让用户体验它与 V4 Pro 的差距究竟有多大。这次开放没有门槛,只要接入 API 就能用,价格也与现行的 V4 Flash 完全一致。
不过在深入测评前,需要先打个预防针:这大概率不是 V4.1 Flash 的最终形态。官方之所以只开放这么短的窗口,更像是为了收集真实反馈。回顾 V4 Flash 刚发布时,其与正式版之间的差距就相当明显——后训练阶段的性能提升往往集中在发布之后。因此本次测试结果仅作为对此特定版本的参考,不能替代任何严肃评分。
评测思路:拒绝单题,六题背对背横评
本次评测刻意避开单一经典题目。原因很简单:模型很可能早已被针对性训练过,做对一道题并不代表真实能力。因此评测采用六道覆盖前端、推理、因果的复合题目,让四款模型同题背对背跑——有比较才有位置感。
参与对比的四款模型分别是:主角 DeepSeek V4.1 Flash、V4 Flash、开启深度思考的 V4 Pro,以及作为标杆的 JLM 5.3 Flash。其中三款 Flash 均为直出模式,V4 Pro 则开启思考模式。所有模型均通过官方 API 直接接入,单次直出,不做任何重跑或筛选。
第一题:风中之布的物理约束模拟
第一题要求生成一块可交互的布料——能显示、能拖拽、能剪裁,且剪开的口子必须真实影响后续运动。四款模型交出的布料质感各异:V4.1 Flash 是深灰棋盘纹,V4 Flash 是双色格子布,V4 Pro 构筑了高达 3648 根物理弹簧的高阶织物,JLM 5.3 Flash 则呈现米色杂质质感的精细网络。
真正的考验在拖拽与横切之后。V4.1 Flash 在模拟一启动时粒子坐标计算瞬间爆炸,整块布直接蒸发,只剩两个固定点;而 V4 Flash、V4 Pro 与 JLM 5.3 Flash 均做到了真实的物理切断与下坠。

核心看点正是物理约束与重力脱落。V4.1 Flash 在这一题上出师不利。
第二题:立方体展开图与三维折叠动画
第二题要求把一张纸变成可旋转、可展开的立方体,且外侧那张面必须始终连着初始状态。结果两款 Flash 级别模型开局双双白屏——V4.1 Flash 和 V4 Flash 都没有渲染出任何几何面。而 V4 Pro 和 JLM 5.3 Flash 成功绘制出完整的六面体平面展开图。

进一步测试三维折叠时,V4 Pro 虽然展开图正确,但旋转轴与闭合逻辑写错,顶盖横向偏转穿插,最终无法闭合成盒,判定失败;JLM 5.3 Flash 则空间动效丝滑,五面紧密闭合,仅顶盖 T 面未扣紧,堪称最佳。
值得关注的是两款 Flash 白屏的底层原因完全不同:V4 Flash 明明拿到了 65536 顶格 Token 预算,却在推导顶盖矩阵时陷入自我怀疑,把一句带问号的推导在代码里疯狂复读了整整 1026 遍,最终把 6.5 万 Token 预算顶爆导致截断;而 V4.1 Flash 是纯手写 3D 引擎时把投影正负号算反,亲手将所有几何面全部剔除了。
V4 Flash 遭遇的「Token 预算顶爆」现象,本质上是自回归语言模型在推理阶段的一种典型失控模式:模型在生成代码注释或内联推导时,因为对某个中间步骤缺乏确信,会反复输出同一段带有不确定性标记的文本(即所谓「复读」),直到触达上下文窗口或最大输出长度的硬性截断。65536 Token 是许多模型 API 的单次输出上限,一旦触达便强制结束生成,导致代码不完整、页面白屏。这与模型「不知道答案」不同——它并非沉默,而是以高度重复的方式消耗了全部预算,属于推理阶段的收敛失败。相比之下,V4.1 Flash 的白屏是纯粹的几何计算错误(投影矩阵符号取反),属于确定性的逻辑 bug,虽同样导致失败,但两者的根因截然不同。
第三题:矢量设计工具与状态机逻辑
第三题要求做一个能用的矢量设计工具,具备增删改色与正确的撤销/重做功能。这一次四家全部交付了高完成度的设计台:V4.1 是包豪斯深色风,V4 Flash 是经典白底工具栏,V4 Pro 功能完备,JLM 则是极具设计感的瑞士海报排版。
在连续操作后一口气撤销到底、再绘制新图形的严苛测试中,四款模型的状态机逻辑全部满分过关。核心看点在于状态机与撤销重做链条——这道题四家全员通关,也是 V4.1 Flash 表现最稳、UI 工业质感最佳的一道题。
第四题:无解排版的最小冲突推理
第四题是纯推理题:一张没有合法解的排版表,要求找全所有最小冲突集,并给出最少修改方案。标准答案是全量五组极小不可满足集,由于存在不相交规则集,最少必须删除两条规则,且恰好只有两种合法排序修复。

结果分化明显:V4.1 Flash 只找了两组冲突后便自我矛盾;V4 Flash 反复推翻自己未收敛直接截断;JLM 5.3 Flash 以轻量直出完整找出全部五组冲突并给出最优解;开启深度思考的 V4 Pro 更是输出 3.7 万字思维链,给出教科书级别的严格数学论证。JLM 5.3 Flash 在此题表现惊艳,V4 Pro 同样满分,两款直出 Flash 则未能收敛。
「极小不可满足集」(Minimal Unsatisfiable Subset,MUS)是约束满足问题(CSP)中的核心概念:在一个无解的约束集合里,MUS 是指移除任意一条约束后整体就变得可满足的最小子集。一个问题可以同时存在多个互不相交的 MUS,这也是为什么本题的标准答案要求找出「全量五组」——遗漏任何一组都意味着模型没有完整掌握冲突结构。要找到所有 MUS 并给出最优删除方案,不仅需要枚举能力,还需要理解 MUS 之间的覆盖关系(即「命中集」Hit Set 问题),这本质上是 NP-hard 的组合优化。JLM 5.3 Flash 以轻量直出完成全部五组 MUS 的推导,说明其在约束推理上具备相当强的系统性搜索能力,而非依赖记忆或模式匹配。
第五题:12秒片头的时间轴容错测试
第五题相对轻松:一部 12 秒纯文字片头,考的是排版和时间轴——随便拖到哪一秒画面都得正确。四家成片风格各异,JLM 是极具美感的三目排版,V4 Pro 和 V4 Flash 干净克制,V4.1 Flash 则视觉丰富、卡片带真实业务标签。

从结尾往回倒放时,四款模型全部保持稳定的时间确定性,全员通关。V4.1 Flash 业务质感扎实,而 JLM 与 V4 Pro 在排版美学上更胜一筹。
第六题:辛普森悖论的因果推断
最难的压轴题藏着辛普森悖论,要求构造两个因果效果完全相反的世界,并算出效应的上下界。这道题的验收线是负 73 到正 27 个百分点,且需全量保留真实观测数据。
令人惊喜的是,四款模型在这道严谨的因果推断题上全部展现了深厚的数理底座——全员识别出辛普森悖论反转,全部构造出符合观测数据的反事实世界,并严格推导出理论界限。国产模型在硬核数理推断上的扎实功底确实令人刮目相看。
辛普森悖论(Simpson's Paradox)指的是:在分组数据中每个子组均呈现某一方向的相关性,但合并后的整体数据却呈现相反方向。这一现象在医学试验、社会统计中屡见不鲜,核心原因是存在「混淆变量」对处理分配与结果同时产生影响。因果推断中处理辛普森悖论需要引入结构因果模型(SCM)或 do-演算,区分「观测到的相关」与「干预后的因果效应」。「效应上下界」对应的是部分识别(Partial Identification)框架——当混淆无法完全控制时,研究者退而求其次,在保留所有真实观测数据的前提下推导因果效应的理论极值区间,而非给出单一点估计。这比直接回答「处理是否有效」在逻辑上更为严谨,也更难被模型正确处理。
总结:V4.1 Flash 得 3 分中规中矩,JLM 5.3 Flash 领跑
六道题综合下来,JLM 5.3 Flash 拿下 5 分强势领跑,展现出经验级的综合实力;开启思考的 V4 Pro 同样 5 分,在因果、代码与深层推理上功底扎实;V4 Flash 拿下 4 分表现稳健;而主角 V4.1 Flash 仅拿 3 分,在直出梯队中中规中矩。
必须再次强调,本次为单次直出测试,结果仅代表当前模型对应特定题目的状态,V4.1 Flash 距离最终形态还有较大空间。从整体看,JLM 5.3 Flash 已在轻量直出赛道打出了标杆级实力,但在国产模型中仍显得稀缺——期待未来能涌现更多类似性能价格组合的模型。
相关推荐

Google AI Studio GitHub 双向同步:导入仓库、Push/Pull 全面打通
Google AI Studio 全面强化 GitHub 集成,支持导入仓库、双向 Push/Pull 同步及可视化 Git 操作 UI。深度解析三大更新如何让 AI Studio 从实验沙盒进化为完整开发环境。

Claude Code国内安装与实战开发全流程指南
详解Claude Code在国内环境下的安装配置、基础环境准备及代码实战全流程,涵盖典型工作流、提示词工程技巧与学习路径建议,帮助开发者快速上手AI编程助手。

AI逆向实战:滑动拼图验证码破解全流程解析
详解AI逆向破解滑动拼图验证码的完整流程,对比古法逆向与AI逆向的效率差异,涵盖WASM加密分析、图像还原算法、轨迹模板匹配等核心技术环节,探讨AI如何改变逆向工程师的工作方式。