DeepSeek V4 Pro正式版实测:编码、3D建模与游戏生成全面评测

DeepSeek V4 Pro 0813版悄然正式发布,以极低价格实现了对预览版的显著能力跃升。
DeepSeek V4 Pro的正式版(代号0813)近日低调上线,几乎无官方公告。这是一个拥有1.6万亿MoE参数(490亿激活)、100万token上下文窗口的开源模型,定价极低(输入0.43美分/百万token)。通过一系列零样本编码与游戏生成测试,V4 Pro 0813相较预览版实现了「显著改进」,在浏览器桌面模拟、3D引擎建模、手表电商网站、电影化游戏等任务上均表现不俗,整套测试总花费仅1.91美元。主要短板是模型在最高推理强度下过于「token贪婪」,会反复验证每行代码甚至调用无法实现的工具,导致时间和成本虚耗。总体而言,这是开源社区值得关注的一次高性价比升级。
静默发布的开源重磅模型
DeepSeek V4 Pro的正式版(GA版)近日悄然上线,代号「0813」。与此前发布的V4 Flash正式版类似,这次的发布几乎没有官方声势——X平台上尚无正式公告帖,只有官网上几处引用暗示:使用V4 Pro的模型标识符时,你实际上会被路由到全新的0813版本。同时该模型已在OpenRouter上线,这基本可以确认它是真正意义上的公开发布。
据B站UP主Bijan Bowen的实测分析,这个版本最值得关注的地方在于它的能力跃升幅度。此前的V4 Pro预览版和V4 Flash预览版都给人「半成品」的感觉——从「preview」的命名来看,这倒也说得过去。但真正让人期待的是:Flash从预览版到0731正式版实现了「巨大」的能力飞跃,如果V4 Pro也能复现同样的进步曲线,那将是一件相当令人兴奋的事。
DeepSeek V4 Pro参数规模与定价
从目前可获得的信息看,V4 Pro 0813拥有100万token的上下文窗口,最大输出长度达到384K,这是一个相当可观的数字。模型支持可选的思考模式(thinking mode),可以调低推理强度,但为了测试极限性能,本次所有编码任务都跑在最高强度上。
关于模型规模,如果假设它与预览版一致,那么这是一个1.6万亿参数的混合专家(MoE)模型,激活参数为490亿。虽然依然庞大,但相比逼近3万亿参数的Kimi K3或Qwen 3.8 Max等模型要「克制」不少,这对开源权重模型而言意义重大。
定价方面则是它最大的杀手锏:目前每百万输入token仅0.43美分,每百万输出token为87美分——便宜到几乎离谱。DeepSeek官方已多次预告API价格即将「大幅上调」,但即便涨价5到10倍,这个价位在同类模型中依然极具竞争力。
据流传的疑似DeepSeek微信群基准数据(未经官方证实),V4 Pro在DeepSWE分数上从预览版的12.8跃升至62.7,若属实,将使其在开源模型中占据非常有利的位置。
混合专家(MoE,Mixture of Experts)是一种模型架构,其核心思想是将模型拆分为多个「专家」子网络,每次推理时只激活其中一小部分。对于1.6万亿总参数、490亿激活参数的配置,意味着实际推理时只有约3%的参数参与计算,大幅降低了单次前向传播的算力消耗。这使得MoE模型能在保持巨大「知识容量」的同时,将推理成本压缩到接近同等激活参数的稠密模型水平。DeepSeek、Mixtral、Qwen等主流开源大模型均采用这一架构。正是由于MoE的稀疏激活特性,V4 Pro才能在拥有海量参数的同时维持极低的API定价。
编码与游戏生成能力实测
Bijan通过Codex以及新发布的ChatGPT桌面版Beta(均路由到DeepSeek最高推理强度)进行了一系列零样本编码测试。
浏览器操作系统模拟
模型生成了一个带有透明背景、合成波(synthwave)风格的模拟桌面系统,配有文件管理器、记事本、计算器、设置、游戏等应用。整体审美与Qwen 3.8颇为相似,还内置了「全息桌面」特效——UP主形容其效果「像Apple Vision Pro头显里的应用演示」。虽然文件系统是静态的,但支持创建和删除文件、neofetch展示等细节相当到位。

滑板游戏与地铁FPS
C++滑板游戏「Skate NYC」耗时约68分钟完成。相比预览版「惨不忍睹」的结果,这次的进步「相当显著」,虽然存在建筑面倾斜、文字歪斜等问题,UP主还调侃「树看起来有点像便便」,但整体已是可玩状态。
地铁FPS测试中,模型画出了「测试中见过的最好的地铁车厢」,场景干净简洁,武器模型平滑,甚至有弹壳掉落的细节。但遗憾的是缺少敌人(僵尸),加上反复的自我排错,最终被判定不够理想。
「零样本(zero-shot)测试」指不提供任何示例或中间修正、直接给出任务描述并要求模型一次性完成的评估方式。这是衡量模型真实泛化能力和工程落地可靠性的严苛标准——不允许人工反复调试,更接近实际开发场景中「冷启动」时的表现。DeepSWE则是专门评估大模型软件工程能力的基准,通过让模型自主完成真实GitHub仓库中的缺陷修复和功能开发任务来打分,满分100分。文中提到的预览版12.8分到0813版62.7分的跃升,若属实,意味着模型在实际工程任务(而非简单代码补全)上的自主解决率从约1/8跃升至超过3/5,是质的飞跃。
3D建模与前端设计测试
RB26直列六缸引擎3D模型
这是一项高难度任务:生成一个可3D打印、几乎无需支撑,并能容纳N20微型直流电机的RB26引擎模型。模型耗时1小时10分钟,做了大量关于引擎各部件方位(下排气管、进气歧管等)的细致研究,甚至下载了电机的图片和参数——尽管它并不具备视觉能力,这一点令人费解。
最终结果被评价为「迄今测试中最好的一个」,装配渲染效果出色,但油底壳等部件的朝向问题使其无法实际打印。UP主的评价颇具洞察:「故事不在于模型本身,而在于它背后所做的研究。」

高端手表前端网站
手表网站测试耗时1小时30分钟,结果「非常接近优秀」。木质背景、皮革展示垫、3D手表资产的电影级平移效果都相当到位,双表对比展示(不锈钢款与金款)可自由旋转,数字刻度甚至采用了多材质细节(金/银配黑色填充)。唯一的败笔是皮革垫遮挡了表带的视野,但整体高端质感令人满意。
电影化叙事游戏生成
通过Codex完成的「Steve the PC Repairman」电影化游戏耗时约65分钟,表现超出预期。游戏利用OpenAI API生成了角色语音资产,多角色对话时头部会自然地左右摆动,配乐也与场景高度契合。虽然谜题拼图未能完全「拼出正确画面」,但各个元素都到位了。

最后的「Street Yeet」街头游戏则是一次彻底的成功——卡通风格出色,节奏明快,物理交互有趣(被击飞的物体会与场景其他元素碰撞),配有连击倍率和计分系统,可玩性极佳。
测试总结:性价比突出但仍有改进空间
整套测试的总花费仅为1.91美元,相比几周前Qwen 3.8 Max测试的约32美元,成本优势极为突出。即便未来涨价5倍,依然算不上昂贵。
综合来看,V4 Pro 0813相较预览版是一次「显著改进」,摆脱了此前「半成品」的观感。不过UP主坦言,从性价比角度,Flash模型给他的惊喜更大(毕竟体积更小);而V4 Pro面临的竞争也更激烈。
最主要的抱怨在于模型「过于token贪婪」——它会不遗余力地反复检查每一行代码,在没有视觉能力的情况下试图启动无头浏览器、截图做热力图,这大大增加了时间和成本。对于零样本测试而言,直接产出结果、由人工反馈修正往往更高效。这或许是最高推理强度带来的副作用,也是一个值得使用者权衡的点。
总体而言,作为一款价格极低的开源权重模型,DeepSeek V4 Pro 0813的这次「转正」,无疑是开源社区值得关注的一步。
「token贪婪」问题在高推理强度(extended thinking)模式下尤为突出。当模型被允许输出大量「思考链」token时,它倾向于穷举式地验证每一个假设,包括在无视觉能力的情况下尝试调用截图、热力图等工具——这些尝试注定失败但仍消耗大量token配额。推理token通常按输出token计费,因此极高的思考深度会成倍放大API成本。用户可通过设置thinking budget参数(即限制推理token上限)来平衡质量与成本,而非无条件使用最高推理强度,这在追求性价比时尤为重要。
相关推荐

DNS系统沦为诈骗温床:新域名滥用率高达20%
Interisle最新报告揭示,全球新注册域名中近20%被用于诈骗活动,8500万新域名中850万被列入黑名单。深入分析DNS滥用成因、ICANN监管困境及普通用户防范措施。

Spotify开源Portal:让Claude Code省下90%的Token开销
Spotify开源工具Portal通过智能上下文管理,帮助开发者将Claude Code的Token消耗削减90%。本文深入解析Portal的工作原理、实际节省效果,以及对AI编程成本优化的启示。

MFA长音频对齐失败怎么办?三步优化策略实战指南
详解Montreal Forced Aligner处理长音频时对齐偏差的常见原因(串音、长静默、填充词),并提供音频预处理、分段拼接、参数精调三大优化策略,帮助语言学研究者大幅提升强制对齐准确率。