DeepSeek V4.1 Flash实测:2亿Token仅花35元

DeepSeek V4.1 Flash内测实测:2亿Token仅花35元,Flash小模型完成3D场景、游戏开发和文学创作等复杂任务。
一位B站UP主对内测中的DeepSeek V4.1 Flash进行了全面压测,消耗近2亿Token,总成本仅约35元。测试涵盖《清明上河图》3D场景生成(91分钟)、Hello Kitty建模、快乐向前冲通关游戏、宜家安装引导网页及文学创作等多项任务。模型全程使用Hide推理模式,通过多Agent并行协作与大量自我迭代来保证输出质量,单任务耗时普遍高于GPT和Grok系列。核心亮点是极致性价比与强大的自我诊断修正能力,以及出乎意料的文学创作质感;短板则集中在数学精度要求高的几何建模场景(如齿轮、OpenSCAD手表),以及较长的推理等待时间。整体结论是:V4.1 Flash正在重新定义"低成本AI"的能力边界,用时间换质量的策略使其产出已接近旗舰模型水准。
引言:小成本模型的大惊喜
近日,一位B站UP主对处于内测阶段的DeepSeek V4.1 Flash进行了深度实测。虽然官方页面显示该模型仍处于"内测"状态,但通过直接调用其模型ID,已经可以正常访问。整个测试过程中,UP主在下午高峰期完成了多项复杂任务,累计消耗了近2亿Token,而最终成本仅约35元。
这个数字本身就极具冲击力——2亿Token对应35元人民币,意味着DeepSeek在成本控制上做到了极致。官方对V4.1 Flash的介绍称其采用了全新的模型结构,具备更强的多模态能力、更快的速度以及更低的成本。而从实测反馈来看,这款Flash级别的模型表现远超预期。
测试配置:Hide推理模式的取舍
本次测试全程使用V4.1 Flash的Hide推理程度,而非Max模式。UP主解释,此前尝试Max模式时,模型的思考过程过于漫长,等待时间难以接受。即便切换到Hide推理程度,单个任务的完成时间依然普遍超过GPT系列和Grok系列模型。
这揭示了一个值得关注的特点:DeepSeek V4.1 Flash虽然在定价上极为亲民,但为了达到高质量的输出,它会投入大量的推理时间和迭代过程。换句话说,它用"时间换质量"的策略来弥补Flash级别模型在参数规模上可能的不足。UP主也推测,当前的模型规模应该比前代V4 Flash更大。
清明上河图3D场景:91分钟的迭代之旅
最令人印象深刻的测试之一,是生成一幅《清明上河图》风格的3D场景。这个任务搭配了DeepSeek的Hannes工具,调用了本地约9000多行的Skill源码。V4.1 Flash的工作流程颇为巧妙:它先读取规格,然后并行派出三个子Agent,分别负责纹理(北宋木构)、船车结构、树木深处。

从成果看,水的质感、木质与砖瓦结构的房屋、有特色的门窗、重复出现的"赵太成家"店铺招牌,以及城墙、桥梁的纹理都做得相当到位。画面中还出现了骆驼、驴、马以及各类小车,造型丰富且质感良好。当然也存在瑕疵,比如部分人物有穿模现象,码头的船只构建不够完整。
值得强调的是整个过程:模型一开始生成的场景充满错误,随后通过查看几十张图片、一轮又一轮的自我修正,最终花费91分钟才呈现出逼真效果。这种"自我诊断+持续迭代"的能力,是本次测试反复出现的亮点。
多任务实测:从3D建模到游戏开发
Hello Kitty 3D建模
UP主让模型制作Hello Kitty的3D模型,包括头部、沙发、桌上的灯、办公椅等物件。初版预览图中头部存在较大缺陷,但经过94分钟的迭代修改,桌子、椅子的金属质感都有了显著提升。UP主认为,其表现优于自己此前用其他工具生成的同类作品。

快乐向前冲通关游戏
在生成一个"快乐向前冲"的通关游戏时,模型自己生成了音效,关卡设计完善,牵绳荡悠悠的物理效果也不错。UP主将其质量与Grok 4.6对比,认为两者"非常非常接近"。该任务耗时95分钟,期间模型在第三、四关反复落水后主动进行了修改。
宜家沙发安装引导网页
将一份宜家沙发安装PDF交给模型,让其生成安装引导网页。成果获得UP主高度评价:选中文字会有醒目的黄色高亮,顶部三个图标设计有趣,页面清爽,还包含沙发到床的转换动画。不过在零部件细节(如六角堵头)和半圆形部件的安装位置上存在还原错误。该任务耗时70分钟,仅图片识别就进行了54次。

意外惊艳:Flash模型的文学创作能力
如果说3D建模展示的是模型的多模态与工程能力,那么写作测试则彻底颠覆了UP主对Flash模型的认知。模型生成的短篇故事,讲述了一个人在医院门口收到复查正常的消息、房东加租通知,以及前任发来"生日快乐"三条信息交织的下午。

文中"原来松一口气也是会疼的""三个同时敲门:一个说你还活着,一个说你得搬走,一个说你曾经被人爱过"等句子,展现出相当细腻的文学质感和情感层次。UP主坦言"平常真的是小看Flash模型了",并邀请观众评分。这段测试说明,V4.1 Flash在文本创作上的表现已经不输更大规模的旗舰模型。
短板与局限:数学建模仍有提升空间
测试并非全无瑕疵。在生成3D齿轮模型(涉及大量数学计算)的任务中,无论是直齿、球形、放射形还是塔形,效果都比较一般,耗时75分钟。UP主指出,多数模型在此类任务上表现平平,目前测过最好的是另一款工具。
此外,在手表建模的OpenSCAD还原中,底部滚轮、表扣等细节存在错误,模型还自行添加了原图中不存在的英文。最后的程序渲染视频,整体效果"还行但未达预期"。这些都说明,Flash级别模型在需要精确几何与数学计算的场景中仍有明显提升空间。
结语:重新定义"低成本AI"的能力边界
综合来看,DeepSeek V4.1 Flash用35元、近2亿Token的成本,完成了从复杂3D场景、游戏开发、网页生成到文学创作的多项高质量任务。它的核心优势在于极致的性价比与强大的自我迭代能力,短板则集中在数学精度相关的建模任务以及较长的推理耗时。
对于开发者和内容创作者而言,V4.1 Flash提供了一个全新的参考坐标:在可接受的时间成本下,用极低的费用获得接近旗舰模型的产出质量。当"低成本"不再等于"低质量"时,AI应用的门槛正在被进一步拉低。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。