DeepSeek新Flash实测:本地视觉推理能力最强的开源模型

DeepSeek新款Flash模型以极高性价比实现原生视觉推理与AutoML能力,KV缓存效率相比前代提升337倍。
DeepSeek最新发布的Flash模型是一次完整的架构重构,体积约为前代两倍,但KV缓存效率相比V1提升约337倍,使得长任务的实际运行成本大幅降低。模型原生集成视觉检测、图像推理和物体计数能力,无需外接计算机视觉流水线。测试者通过DeepSeek官方Harness验证了模型在3D渲染自验证、技术图纸尺寸提取、物体计数以及AutoML等场景下的表现,认为它是首个真正擅长训练机器学习模型的开源权重模型。主要短板是边界框定位存在偏移。综合能力虽不及顶级旗舰模型,但凭借极低的价格,它在视觉分析和长时程子Agent场景中具备显著的性价比优势。
DeepSeek上周发布的全新Flash模型,被不少测试者评价为该团队近期最令人印象深刻的版本之一。它不仅在效率上做到极致,更关键的是原生具备视觉检测、图像推理和物体计数能力——这意味着你不再需要外接任何计算机视觉流水线。本文基于一位B站UP主(转载自YouTube)对该模型的深度实测,梳理它的真实表现与适用场景。
架构重构与惊人的效率提升
这一代Flash并非简单迭代,而是相对前代Flash的完整架构重设计。模型体积几乎是上一代的两倍,但效率反而大幅提升。测试者特别强调了KV缓存的优化——相比V1模型,KV缓存效率提升了约337倍,这是一个相当夸张的数字。
更直观的体现是在实际长任务中的缓存命中率。测试者展示的一个案例里,缓存命中率高达99.7%,总计约4000万tokens的生成量中,接近3900万tokens都命中了缓存。这意味着在运行长时程的Agentic任务时,用户实际支付的是缓存价格而非普通输入价格,成本被大幅压低。使用API时还能达到约300 tokens/秒的速度。

从定价角度看,测试者直言这可能是当前性价比最好的模型之一。虽然不适合做主控(orchestration),但作为子Agent(sub-agent)或本地运行都是极佳选择。
KV缓存(Key-Value Cache) 是大语言模型推理中的核心优化机制。在Transformer架构中,每次生成新token时,模型需要对所有历史token重新计算注意力机制中的Key和Value矩阵。KV缓存将这些计算结果储存起来,后续步骤直接复用,从而避免重复计算。在长上下文任务中,缓存命中率越高,实际计算量越低,成本与延迟都会显著下降。337倍的效率提升意味着在处理相同长度的上下文时,模型所需读写的缓存数据量大幅减少,这对于需要反复访问长文档或长对话历史的Agentic任务尤为关键——Agent每一步行动都建立在完整历史记录之上,累积token数往往达数十万量级,缓存效率直接决定实际运行成本是否可承受。
Harness选择决定性能上限
测试中反复被强调的一点是:运行模型所用的Harness(执行框架)会极大影响最终表现。这一点对所有模型都成立,但在DeepSeek这里尤为明显。
测试者引用了DeepSeek官方在Terminal Bench 2.0上的实验数据:同一个DeepSeek v1.1模型在不同Harness下的得分,从69.8%一路跨到74.2%,跨度接近5个百分点。选错Harness就会得到次优结果。
测试者本人主要使用DeepSeek官方的"DeepSeek Harness",并在两台DGX设备上本地运行。他认为这是目前针对DeepSeek模型最好的执行框架之一,其核心优势在于内建了"规划—实现—视觉验证—迭代"的闭环流程。
Harness(执行框架) 在AI Agent语境中,指包裹模型API调用的完整工程脚手架,通常涵盖提示词模板、工具调用逻辑、错误重试机制、多步骤任务编排以及上下文管理等环节。同一个底层模型在不同Harness下会被赋予截然不同的"行为模式"——例如是否具备工具调用能力、是否支持多轮规划、是否能接收并处理中间结果。Terminal Bench 2.0是一个专门评测模型在终端环境中完成复杂多步骤任务能力的基准,涉及代码执行、文件操作等真实工程场景,对Harness设计极为敏感。这也是为什么在比较不同模型的基准成绩时,若使用的执行框架不同,数字本身的可比性会大打折扣。
视觉生成:会自我验证的3D渲染
模型的视觉生成能力是本次升级的亮点。测试者第一个实验是获取国际空间站的实时位置并渲染到3D地球上。结果不仅渲染质量出色,还准确还原了昼夜分布——北美处于夜晚、亚洲处于白天的细节都被正确呈现。

这背后的关键机制是:DeepSeek Harness让模型先做实现,再通过浏览器进行视觉验证,因为模型现在能接收视觉输入并据此迭代。测试者观察到这已经成为该Harness的固定模式——规划、实现、验证的循环持续运行。
其他生成案例还包括带云层和可调时间的场景渲染、水中游动的海龟,以及颇具设计感的1-bit风格视觉。相比前代Flash几乎做不出像样视觉设计,这一代在Harness加持下有了质的飞跃。
AutoML:首个擅长训练ML模型的开源权重模型
测试者认为这是"第一个真正擅长训练机器学习模型的开源权重模型"。他提供了一个数据集,仅给出简短说明后要求模型自主判断、不再追问。

模型随后自行制定方案、执行特征选择、用不同超参数跑了多组实验,来筛选最优模型——这套流程几乎复刻了一名机器学习工程师的工作方式。更有意思的是,测试者故意设置了一个模糊且存在"数据泄漏"的特征陷阱,而模型竟然主动识别出来并剔除了该特征。测试者表示会专门制作一期关于"用大语言模型做AutoML"的深度视频。
数据泄漏(Data Leakage) 是机器学习中一类严重的建模错误,指训练集中包含了在真实预测时本不应存在的信息,导致模型在测试集上表现虚高但实际部署效果差。常见形式包括:将预测目标的未来信息混入特征、用全量数据做标准化后再切分训练/测试集,以及使用强相关代理变量等。测试者故意构造含泄漏特征的数据集,是一个具有相当判别力的陷阱——许多初级工程师也会忽略此类问题。模型能主动识别并剔除该特征,说明它不只是机械执行建模流程,而是具备了一定的数据质量审查意识,这也是测试者将其评价为"首个真正擅长AutoML的开源权重模型"的核心依据之一。
原生视觉分析:强在提取,弱在框选
模型的原生视觉推理是测试者最看重的实用能力。他正在构建一个专门评测视觉语言模型的基准,直接通过API调用(非Harness环境)做单次预测。

在从技术图纸中自动提取各部件尺寸的任务上,模型的表现出人意料地好。测试者反复强调,输入的提示词本身会极大改变结果,需要精心设计。
不过存在一个明确的短板:边界框(bounding box)经常出现偏移,框可能没有精确包住目标物体。但有意思的是,尽管框的位置不准,实际提取出的数据(如标注的数字20)却是准确的。如果要用它做自动化评估,需要注意这一点。
在物体计数与推理上,模型表现强劲。测试者要求它检测所有水上交通工具并分类,毫无压力;进一步追问"有多少艘船不是帆船,用一个整数回答",模型也能准确对图像进行推理并给出正确答案。
边界框(Bounding Box) 是计算机视觉中用于定位目标物体的矩形区域,通常以左上角坐标加宽高、或左上右下两点坐标的形式表示。在视觉语言模型中,生成准确边界框是一项独立能力——它要求模型将语义理解("这是一扇门")与精确的空间坐标输出(在图像坐标系中确定矩形的四个数值)同时做对。两者所依赖的能力路径并不相同:语义识别主要依赖视觉-语言对齐训练,而精确定位则更依赖专门的检测头或坐标回归训练数据。Flash模型出现"内容识别准确但框偏移"的现象,正是反映了当前多模态大模型在这两项能力上发展不均衡的典型状态,对于需要将检测结果送入下游自动化流程(如裁剪、测量或二次标注)的场景,需要额外的后处理步骤来修正坐标偏差。
定位与适用场景
测试者坦言本视频没有讨论跑分,因为他认为该模型在综合能力上不及Opus 5这类顶级模型。但他的核心观点是:并非每个应用都需要SOTA能力。
对于视觉分析场景,这是一个极其便宜且精度足够高的选择;对于长时程运行的Agent,它作为子Agent(尤其在合适的Harness下)非常称职。综合价格因素,无论是本地部署还是API调用,它都是当前一个相当有竞争力的选项。
相关推荐

LynnReal-Omni:32B统一视频扩散模型开源,四步生成多任务全覆盖
LynnReal-Omni 是基于 MiniMax H3 架构的 32B 统一视频扩散模型,支持文生视频、图生视频、姿态引导、视频修复等多任务,四步快速生成,Flash 版单张 H100 上 377ms 完成 540p 视频,权重与 ComfyUI 节点已开源。

Anthropic联合创始人:AI"紧急停止开关"或应强制立法
Anthropic联合创始人向BBC表示,AI系统的"紧急停止开关"(kill switch)可能需要通过法律强制推行。本文分析这一呼吁背后的产业逻辑、技术挑战以及监管与创新之间的张力。

AI数据中心建设热潮,正冲击工业创伤深重的城市
AI数据中心建设热潮正与曾受重工业创伤的城市社区激烈碰撞。以费城为例,全国性反对声浪聚焦能耗、水资源与环境公平问题,揭示AI增长与地方利益的结构性冲突。