DeepSeek V4 Flash视觉版实测:速度惊艳但设计能力堪忧

给文本模型装上「眼睛」:DeepSeek视觉版来了
DeepSeek近期通过API开放了V4 Flash的视觉版本,引发本地部署社区的广泛关注。作为一款主打速度的模型,它在双Spark系统上的表现究竟如何?视觉能力的加入是锦上添花,还是画蛇添足?B站UP主对这款实验模型进行了一轮完整实测,并将其与GLM 5.3 Flash、QWEN 3.8 Flash等竞品进行了正面对比。
结论颇有意思:这款模型速度极快、智能代理(Agent)能力扎实,但在视觉设计任务上却表现平平。测试者一针见血地指出——「他们给了一个文本模型眼睛,但并没有构建一个天生带眼睛的模型」。这句话精准道出了当前多模态模型移植的核心矛盾。
基准排名与实际体验为何对不上号
根据Artificial Analysis的评估,这款视觉模型被排在略低的位置,因为它牺牲了一部分视觉能力。然而从智能代理指数(Agentic Index)来看,它的表现却相当出色,排名甚至高于27B模型,而此前的0731版本仅排在第48位。
智能代理(Agent)能力指的是大语言模型自主规划、调用工具、执行多步骤任务的能力,而非简单地回答单轮问题。一个具备Agent能力的模型能够理解复杂指令、将任务拆解为子步骤、调用浏览器/代码执行器/API等外部工具、根据中间结果动态调整策略。Agentic Index(智能代理指数)正是评估这种能力的专项基准,它衡量模型在工具调用准确率、多步推理成功率、任务完成效率等维度的综合表现。这一指标的重要性在于,传统的MMLU、HumanEval等基准主要测试知识储备和编码能力,无法反映模型在真实自动化工作流中的实际表现。
这种排名上的错位反映了一个现实:单一的综合基准分数很难全面刻画模型的真实能力。测试者透露,DeepSeek V4.5预计将在9月某个时间点发布,而当前测试的仍是实验性质的版本,并非官方正式版。
说个细节,视觉能力的实现方式很关键。测试者观察到,该模型在处理图像时并没有调用任何外部工具(如SIM或工具调用),而是模型本身直接「意识到」了图像内容——这是它之前的纯文本版本做不到的。从推理过程投入的细节量可以判断,DeepSeek确实集成了一个相当扎实的图像编码模块。这意味着视觉信息并非通过外部管道间接传入,而是在模型的前向推理过程中被直接处理,图像特征经由视觉编码器转换后直接参与了模型内部的注意力计算。

速度实测:双Spark系统上谁才是王者
速度是DeepSeek V4 Flash的核心卖点。在双Spark(Dual Spark)解决方案上,测试给出了以下关键数据:
- DeepSeek V4 Flash:峰值约每秒53个Token(FP8量化)
- GLM 5.3 Flash:峰值约每秒46个Token
- TP4张量并行下QWEN 3.8:峰值可达100–115 Token/秒
这里有必要解释几个关键技术概念。双Spark系统指的是使用两块高性能GPU协同工作的本地部署方案。张量并行(Tensor Parallelism,简称TP)是分布式推理中的核心策略之一,它将模型的权重矩阵沿特定维度切分到多块GPU上,每块GPU负责计算矩阵的一部分,再通过高速互联(如NVLink)汇总结果。TP2表示将模型切分到2块GPU上,TP4则切分到4块。张量并行的优势在于能显著降低单卡显存压力并提升吞吐量,但其效率高度依赖GPU间的通信带宽——如果使用PCIe而非NVLink连接,通信瓶颈可能抵消并行带来的速度增益。这也解释了为什么QWEN 3.8在TP4配置下能达到更高的Token速度。
测试者强调,单流和双流场景下三款模型都相当扎实,一旦进入更高并发,各模型的扩展性差异才逐渐显现。他运行的是DeepSeek官方提供的FP8量化版本。FP8(8位浮点数)量化是一种将模型参数从常见的FP16或FP32精度压缩到8位浮点表示的技术。与传统的INT8整数量化不同,FP8保留了浮点数的指数位,因此在表达极大或极小数值时更具灵活性,能更好地保留模型原始精度。在大模型本地部署场景中,FP8量化可以将显存占用降低约一半,同时将推理吞吐量提升30%-50%,且精度损失通常控制在1%以内。测试者指出如果想复现该配置,可以使用RTX 6000甚至3090显卡以不同量化方式部署。

一个重要的观点是:模型快并不等于任务完成得快。测试者反复强调,更聪明的模型可能凭借更精准的推理反而更快地完成任务,所以「峰值Token速度」这一指标需要结合实际任务完成效率来看待。这一观点在Agent场景中尤为重要——一个高速但需要多次试错的模型,总耗时可能远超一个稍慢但一次到位的模型。
智能代理能力:DeepSeek V4 Flash的真正强项
在实际的测试框架中,DeepSeek V4 Flash展示了完整的智能代理工作流——它自主部署了浏览器,并利用浏览器抓取了实时世界新闻。整个过程延迟表现优秀,首字延迟(TTFT,Time to First Token)非常低。首字延迟是衡量大模型推理响应速度的关键指标,指从用户发送请求到模型输出第一个Token之间的等待时间。这一延迟主要由输入处理阶段(prefill phase)中模型对整个输入序列进行前向计算的耗时,以及系统层面的调度和网络传输开销构成。对于Agent场景,低TTFT至关重要——因为Agent通常需要多轮调用模型,每一轮的首字延迟都会累积,直接影响整个任务链的完成时间。在视觉模型中,图像编码的额外计算开销往往会增加TTFT,因此DeepSeek视觉版能保持低延迟说明其图像编码模块的效率较高。
从智能代理指数的对比来看,几款模型的排位相当接近:
| 模型 | 智能代理得分 |
|---|---|
| DeepSeek V4 Flash | 52分 |
| GLM 5.2 Flash | 53分 |
| GLM 5.3 Flash | 57分 |
| QWEN 3.8 Flash | 56分 |
测试者坦言,DeepSeek V4 Flash能够完成他日常约90%的工作,尤其是从智能代理角度——「它足够快、足够聪明,能作为日常主力模型处理绝大多数任务」。对于不构建全新项目、只是用本地模型运行代理任务的用户而言,DeepSeek的速度优势极具吸引力。
短板暴露:设计能力差强人意,幻觉率居高不下
然而,视觉能力的加入并未转化为设计能力的提升。测试者尝试让模型做一个网页设计任务,结果「糟糕透了」——生成的内容混乱不堪,甚至差点让电脑卡死。

他给出了深刻的分析:
「你给一个模型视觉,并不意味着它自动就能做设计。但如果你用视觉从头训练一个模型,那就完全不同了。」
这揭示了「后期移植视觉」与「原生多模态训练」之间的本质差异。当前多模态大模型主要有两种技术路线。第一种是"后期移植"(late fusion):先训练好一个强大的纯文本模型,再在其输入端接入一个预训练的视觉编码器(如CLIP的ViT),通过一个轻量级的投影层(projection layer)将图像特征映射到文本模型的嵌入空间,然后进行有限的多模态微调。这种方式成本低、迭代快,但视觉信息本质上是作为"外挂"输入的,模型的核心推理逻辑仍然围绕文本展开。第二种是"原生多模态训练"(early fusion):从预训练阶段就同时喂入图文交织的数据,让模型从底层学习视觉与语言的联合表征。这种方式训练成本极高,但模型对视觉信息的理解更深层、更内化,在需要视觉审美判断、空间推理、设计生成等任务上表现显著更优。
DeepSeek本质上采用的是第一种路线——在一个强大的文本推理模型上附加了视觉输入能力,而非围绕视觉重新设计整个训练流程,因此在需要视觉美学判断的设计任务上力有不逮。
幻觉率:DeepSeek最薄弱的环节
另一个关键短板是幻觉率,这也是DeepSeek表现最差的维度。幻觉(Hallucination)是大语言模型生成看似流畅合理但实际上不准确或完全虚构内容的现象。幻觉可分为两类:内在幻觉(与输入信息矛盾的输出)和外在幻觉(输出中包含无法从输入或训练数据验证的信息)。在Agent场景中,幻觉问题尤其危险,因为模型的错误判断可能被传递到后续的工具调用和决策链中,造成级联失败。
具体数据如下:
- DeepSeek幻觉相关得分仅约9%(数字越高越好)
- GLM 5.3 Flash得分高达72%,排名第四,甚至优于其自家更大的模型
在需要事实准确性的场景中,GLM系列明显更可靠,同时它也是更好的设计模型。这一巨大差距可能与训练数据的质量和规模有关——GLM系列在中文事实性数据上的训练投入可能更为充分,而DeepSeek V4 Flash作为速度优先的模型,可能在训练过程中为了保持推理效率而牺牲了部分事实对齐的训练。

选型指南:速度与智能该怎么取舍
最终的选择归结为一个经典命题:你要更聪明但更慢,还是没那么聪明但更快?
测试者的建议非常务实:
- 如果你需要同时运行多个代理并保持良好速度,DeepSeek相比GLM 5.3 Flash扩展性稍逊,但单模型速度是其两倍(DeepSeek约80 Token/秒 vs GLM约30–40 Token/秒)。
- 如果你重视设计能力和低幻觉率,GLM 5.3 Flash是更稳妥的选择。
- 在高并发扩展场景下,测试中出现了有趣的反转——虽然GLM在部分测试(C3、双流)中领先,但DeepSeek在C4、C5、C6等更高并发下能够「追上并成为更好的模型」。这里的C3-C6指的是同时处理的并发请求数量,反映了模型在实际多用户或多Agent同时调用时的吞吐能力。
值得一提的是,模型的扩展性表现证明:你并不一定需要4-Spark系统。测试显示双Spark运行TP2与4-Spark运行的单流性能差距很小,只有在进入更高并发时才拉开差距。这对预算有限的本地部署用户是个好消息——两块GPU就能获得接近四块GPU的单请求体验,只有当你需要同时服务多个Agent或用户时,额外的GPU投入才变得必要。
值得期待的实验之作
测试者用「55开的打火机」形容自己的整体感受——一半惊喜一半遗憾。他直言:「我觉得这个模型的排名应该更高」,这与部分基准测试的评分形成了反差。
DeepSeek V4 Flash视觉版是一次扎实的多模态移植:它保留了原有的速度和智能代理能力,并新增了真实的图像理解能力。虽然设计能力和幻觉率仍是明显短板,但对于将其作为日常主力模型的用户而言,它「已经足够快、足够聪明」。随着传闻中的V4.5即将到来,DeepSeek在本地大模型赛道的竞争力值得持续关注。这款模型也为行业提供了一个有价值的参考案例:在多模态能力的竞赛中,"如何加入视觉"与"加入了多少视觉"同样重要,技术路线的选择将决定模型能力的天花板。
相关推荐

MiniMax H3实测:SLA注意力+4步LoRA加速二次元视频生成
实测MiniMax H3模型在RTX 3080 Ti笔记本上结合SLA稀疏线性注意力与4步LoRA蒸馏加速生成二次元视频,16GB显存下5秒视频仅需250秒,附详细技术拆解与创作者实践指南。

AI写代码快10倍,攻击面也涨10倍?前谷歌工程师的安全警告
前谷歌资深工程师Steve Yegge在AI Engineer大会上警告:AI将代码产出提升10倍的同时,安全缺陷攻击面也膨胀10倍。本文解析AI编程带来的新型漏洞、Slop Squatting幻觉抢注攻击,以及如何用五遍法则和安全工具应对智能体时代的安全挑战。

CUDA生态如何让A100服役十年:英伟达护城河深度解析
深度解析英伟达CUDA软件生态如何让A100 GPU保持近十年服役能力,从通用性到可替代性的价值链,揭示GPU如何从技术产品转变为可租赁、可融资的生产性资产,以及CUDA构建的真正护城河。