DeepSeek V4.1 Flash实测:400Token/s极速生成,3D建模能力惊艳

DeepSeek悄然发布仅两天窗口期的V4.1 Flash,以400 Token/s的惊人速度和原生多模态能力预演新一代架构方向。
DeepSeek在正式发布前推出了限时两天的实验性模型V4.1 Flash,不附带任何官方基准测试,直接向开发者开放API测试。实测显示其生成速度可达400 Token/s,在3D场景生成、前端代码创作和智能体任务中均表现出色——能一次运行生成完整可交互的中国古典园林、体素艺术场景和Minecraft克隆,并在自动地牢游戏测试中一次成功完成寻路任务。主要短板在于"过度思考"导致整体完成时间偏长,以及物理模拟精度不足。同期DeepSeek还下调了V4 Flash的正式定价,整体呈现出"更快、更便宜"的明确产品方向。
一次疯狂的临时发布
DeepSeek 团队近日给社区带来了一个惊喜——在第四代模型系列中悄然推出全新的 DeepSeek V4.1 Flash。与常规发布不同,这是一个仅有两天窗口期的中间测试版本,将于 9 月 10 日到期。DeepSeek 没有公布任何官方基准测试、参数量或权重信息,而是采取了一种颇为大胆的做法:直接把接口丢出来,让开发者自己去折腾。
用户可以通过现有的 DeepSeek API 访问它,模型 ID 为 DeepSeek-V4.1-Flash,定价与 V4 Flash 保持一致,测试期间每个账号最多支持 20 个并发请求。更耐人寻味的是,DeepSeek 甚至在主动询问测试者:这个新架构最终能否完全取代 V4 Pro?这种带有强烈实验性质的发布方式,本身就透露出团队对新架构的信心与探索意图。
据这次实测的 UP 主分析,V4.1 Flash 基于全新架构,原生支持多模态,速度明显提升,而定价却与前代持平。这意味着它不是简单的迭代,而是一次架构层面的重构尝试。

速度实测:每秒逼近400 Token的生成表现
这款模型最令人震撼的特性就是速度。实测中,V4.1 Flash 的生成速度大约达到每秒 400 个 Token,峰值甚至冲到了 427 Token/s。作为对比,它在速度上已经能与 Mixtral 8x7B 这类以快著称的模型抗衡,而成本却低得多。
在实际的代码生成任务中,模型在解码阶段平均维持在每秒 300 到 400 个 Token 之间。对于一个具备推理能力的模型来说,这个吞吐量确实相当惊人——尤其考虑到它还只是一个临时测试版本。
不过速度层面也存在一个明显的短板:过度思考。实测者指出,V4.1 Flash 最大的问题在于它常常花费过多时间进行不必要的推理和测试运行,这拖慢了整体完成时间。例如在「3D 场景创建世界七大奇迹」的对比测试中,V4.1 Flash 花了约两小时才完成两项任务,成本 2.6 美元;而对手的神秘模型(很可能是 Grok 4.7)仅用 30 分钟就完成。虽然最终输出质量出色,但解码快、思考慢的矛盾是这个测试版本尚待优化的地方。

DeepSeek V4 Flash价格再下调
速度之外,DeepSeek 还宣布将在 9 月 10 日北京时间中午 12 点下调 V4 Flash 的价格:
- 缓存命中输入:从每百万 Token 约 0.0075 美分降至 0.003 美分
- 缓存未命中输入:从约 22 美分降至 15 美分
- 输出:从 67 美分降至每百万 Token 60 美分
高峰时段定价仍维持两倍不变,但整体趋势非常明确——DeepSeek Flash 系列正在同时变得更快、更便宜。对于此前对新定价有所不满的用户来说,这无疑是一个积极的信号。
3D建模与前端代码生成能力的飞跃
真正让这次测试出圈的,是 V4.1 Flash 在 3D 建模和前端代码生成方面的表现。
中国古典园林与体素艺术
当被要求用 Three.js 创建一个中国古典园林时,V4.1 Flash 一次运行就生成了完整的场景:包括走廊、带反射效果的池塘(倒映着各个建筑)以及大量意想不到的细节。更关键的是,整个环境在浏览器中是可交互的,而非静态画面。这种复杂度是过去 DeepSeek 第四代模型难以企及的。
在体素艺术测试中,模型甚至加入了微妙的环境氛围、小鸟、可运行的瀑布和风车等组件——这些细节是大多数模型在体素环境中往往会忽略的。

Minecraft 克隆与火山岛场景
实测中,V4.1 Flash 还成功构建了一个完整的 Minecraft 克隆版,仅用约 8 分钟、成本几分钱。它能编写不同的纹理和组件,虽然精细度不及 GPT-6 或 Fable 5.1,但完成度出乎意料。另一个亮点是位于火山旁独立岛屿的场景,模型不仅生成了地形、光照和火山模拟,还加入了环境音效、背景音乐以及昼夜切换器。
火箭发射模拟的物理短板
在火箭发射模拟对比中(对手为 Fable 5.1、GPT-6 Astra 和 Chimera 3),V4.1 Flash 的视觉质量相比前代有明显提升,但物理效果仍显不足——火箭发射后会像喝醉一样在空中扭动,无法沿真实轨迹飞行。这是它相对高端模型的明显差距,但考虑到它是 Flash 变体、成本极低且速度可能比 Chimera 3 还快,这个短板尚可接受。
智能体行为与空间推理能力提升
除了生成质量,V4.1 Flash 在智能体行为和空间推理方面也有实质进步。在一个「自动地牢游戏」测试中,它一次尝试就完成了任务,而其他模型通常需要至少两次尝试,且经常因寻路能力差卡在墙壁边缘。模型还为每个敌人添加了不同纹理、生物、环境音效和动画。
在相机 3D 爆炸图测试中,第一版约一分钟生成,再经两轮交互后在六分钟内完成——最终可分解查看相机的各个零件,交互细节相当完善。此外,它还在 harness 中构建了完整的马里奥赛车风格游戏,生成了音效、多张地图和不同环境,成本约 1.1 美元,并原生调用视觉能力完成任务。

总结:一次值得关注的新架构预演
综合来看,DeepSeek V4.1 Flash 展现了团队在新架构上的清晰方向:以速度为核心,整合原生多模态视觉,并在多个领域提供令人印象深刻的能力。它的短板(过度思考、物理模拟不精)也很明确,但作为一个仅有两天生命周期的测试版本,这些正是团队收集用户反馈、优化检查点的目的所在。
对开发者而言,这也提示了一种实用的工作流:用低成本的 V4.1 Flash 完成大量基础或复杂任务,再切换到 GPT 或 Fable 等模型处理更精细的工作。如果这确实是新一代模型系列的预览,那么 DeepSeek 接下来的正式版本值得高度关注。测试窗口有限,感兴趣的开发者不妨抓紧时间亲自体验。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。