DeepSeek V4 Pro实测:5元完成5个复杂编程项目

DeepSeek V4 Pro上线:百万上下文、白菜价Token
DeepSeek在近日正式上线了 DeepSeek V4 Pro 0813 模型。根据官方文档,这款模型支持 100万上下文长度,最大输出Token达到 384K。更引人注目的是它的定价策略:在缓存命中的情况下,每百万输入Token仅需 0.025 元人民币,每百万输出Token为 6 元人民币。
100万Token的上下文窗口意味着模型可以在单次对话中处理约75万个英文单词或约50万个中文字符的信息,相当于一次性读入一整本长篇小说或数十个代码文件。上下文长度一直是大语言模型的核心瓶颈之一——早期GPT-3仅支持4K Token,GPT-4将其扩展到128K,而百万级上下文则意味着模型可以在不丢失信息的情况下完成跨文件代码重构、长文档分析等复杂任务。实现超长上下文通常需要稀疏注意力机制、RoPE位置编码外推等技术手段来降低显存占用和计算复杂度。
而所谓"缓存命中"定价,是API服务商为降低用户成本而设计的机制。当用户多次调用中存在相同的前缀内容(如系统提示词或重复的上下文),服务端会缓存这部分内容的KV Cache,后续请求无需重新计算,因此可以大幅降低计费。0.025元/百万Token的缓存命中价格,相当于每处理一本10万字的中文书籍仅需不到1分钱,这种定价策略特别适合Agent类应用——这类应用往往需要在多轮交互中反复传递大量相同的上下文。
对于开发者而言,这样的价格几乎可以忽略不计。本次实测通过 API 方式将 DeepSeek V4 Pro 接入 Claude Code,从零开始验证它在真实编程场景下的能力——涵盖 SVG 动画、3D 建模、游戏开发、原生 App 开发等多个维度。Claude Code是Anthropic推出的命令行编程助手工具,原生使用Claude系列模型,但通过OpenAI兼容API接口,开发者可以将其底层模型替换为任何兼容的第三方模型。DeepSeek的API遵循OpenAI API格式规范,因此只需修改base_url和API key即可无缝接入Claude Code的工作流,利用其成熟的工具调用框架(如文件读写、命令执行、浏览器操作等),同时享受DeepSeek更低的Token成本。测试开始前账户余额为 18.58 元,全部测试结束后仅消耗 5.36 元,成本控制堪称惊艳。
SVG动画测试:与Kimi K3仍有差距
第一项测试沿用了此前测试 Kimi K3 时使用的经典题目:让三种鸟(渡渡鸟、几维鸟等)在土星星环上进行自行车比赛,星环充当赛道。
DeepSeek V4 Pro 选择用 Python 生成 SVG 动画,并在完成后自动打开预览,说明其工具调用能力相当成熟。生成的三只鸟形态辨识度高,骑车动作也较为自然。不过明显的缺陷是 土星环赛道并未真正围绕土星,与背景星空中的地球、火星、木星等行星相比,星环处理不够贴合。

对比来看,Kimi K3 在这道题上的完成度更高——星环确实围绕土星运转,鸟类蹬踏脚踏板的动作也更加细腻。这说明 DeepSeek V4 Pro 在 SVG 动画生成方面相比 Kimi K3 仍有一定差距,但差距并不算大。SVG(可缩放矢量图形)动画的生成对AI模型是一项独特挑战:它要求模型同时处理空间几何关系(路径坐标、变换矩阵)和时间序列(关键帧、缓动函数),还需要保持视觉上的美观和物理上的合理性。
齿轮机械动画:碾压V4 Flash
第二道题要求用 Three.js 构建单页文件演示可变速齿轮结构。Three.js是基于WebGL的JavaScript 3D图形库,是目前Web端最流行的3D渲染框架之一,它封装了底层的着色器编程和矩阵运算,让开发者可以用相对简洁的代码创建复杂的3D场景。
等待约20分钟后,模型给出了成品:齿轮紧密啮合,可以360度旋转查看结构,还额外增加了电机带动第一个齿轮转动,并支持调节转速。齿轮啮合动画涉及精确的几何计算——每个齿轮的齿数、模数、压力角都需要匹配才能实现物理正确的啮合,模型能够正确处理这些参数关系,说明其对机械工程基础知识和3D编程API都有较好的掌握。这个效果远超此前 V4 Flash 版本的表现,与 Kimi K3 的完成度基本持平。
复杂长任务:飞船复刻反超Kimi K3
真正拉开差距的是一道高难度测试题:要求模型 联网搜索并阅读科幻小说《极光》,然后用最合适的前端技术尽可能100%还原书中的宇宙飞船模型,并具备动态效果,还需支持切换到飞船内部探索。

这道题不仅考验工具调用与长文本理解能力,还要求模型自主选择技术栈。令人印象深刻的是,DeepSeek V4 Pro 在搜索过程中 识别出了搜索结果中的矛盾,主动指出需要查找更权威的书中原文进行校验,随后更换关键词重新检索飞船布局。这种自我纠错的推理能力体现了模型的智能程度——它不是简单地接受第一个搜索结果,而是像一个有经验的研究者那样交叉验证信息源的可靠性。这种行为在AI Agent研究中被称为"反思性推理"(reflective reasoning),是衡量模型自主性的重要指标。
约27分钟后成品出炉:飞船由小变大逐渐呈现,可拖动查看细节,能看到远处目标行星、通过磁场清除尘埃的防护盾、载人舱室等。点击还能进入飞船内部,顶部模拟天空、底部模拟草地地面,还原度极高。
有意思的是,Kimi K3 在这道题上出现了结构性错误——没有将飞船舱室像轮子一样连接,排列方式与原著不符。因此这道题 DeepSeek V4 Pro 的表现反超了 Kimi K3。
游戏开发测试:细节完成度超预期
南宋临安追杀游戏
以南宋古城临安为背景,黑衣人追杀白衣人的动作游戏,耗时26分钟完成。玩家可飞行、挥剑,击倒黑衣人可回血;场景中还有路人、小贩以及店铺招牌等丰富细节。无论玩法还是场景细节,其完成度都超过了 Kimi K3,基本实现了一个可玩的 MVP(最小可行产品)。

Godot引擎3D坦克大战
更大的挑战是使用 Godot 引擎 开发一款3D射击游戏:玩家驾驶坦克在侏罗纪时代射击恐龙,同时加入UFO飞碟和音效。Godot是一款开源免费的游戏引擎,使用自创的GDScript脚本语言(语法类似Python)。相比Unity(C#)和Unreal Engine(C++/Blueprint),Godot的社区规模较小,互联网上可用的代码示例和教程也相对有限,这意味着大语言模型在训练阶段接触到的Godot相关数据远少于Unity等主流引擎。
耗时32分钟完成后,坦克可自由移动射击,天空有翼龙和会发射炮弹的飞碟,地面有火山、树木、石头和各色恐龙。考虑到 Godot 引擎的训练数据相对稀少,能实现如此完整可玩的效果实属难得——模型展现出了较强的跨框架泛化能力,即使训练数据稀疏,也能基于对编程逻辑的通用理解来生成正确代码。而此前 V4 Flash 版本开发的同类游戏根本无法运行,这一对比更凸显了V4 Pro在代码生成质量上的飞跃。
原生开发与数学可视化
Manim数学公式可视化
要求用 Manim 可视化二次函数,显示表达式、绘制曲线、标注顶点和零点,并用动画展示绘制过程。Manim(Mathematical Animation Engine)最初由数学科普YouTuber 3Blue1Brown开发,用于制作其标志性的数学可视化视频。该工具使用Python编写,可以通过代码精确控制数学对象的创建、变换和动画过渡,要求开发者同时具备LaTeX数学排版知识和Python编程能力。对AI模型而言,还需要正确理解数学概念才能生成准确的可视化——例如二次函数的顶点坐标计算和零点求解都必须数学正确。
仅耗时4分钟,模型便输出了流畅的1080P视频,标注准确,效果远优于 V4 Flash。
SwiftUI音乐播放器开发
最后一项测试要求用 SwiftUI 开发一款仿 Apple Music 的 macOS 原生音乐播放器,包含首页推荐、音乐库、播放页、迷你播放器等功能。SwiftUI是Apple在2019年推出的声明式UI框架,用于构建iOS/macOS/watchOS等Apple生态原生应用。与Web开发不同,原生开发的代码必须严格遵循平台SDK的API规范,且版本兼容性要求极高——某个API可能仅在macOS 14+可用。此外,SwiftUI的训练数据相比React等Web框架要少得多,因为它更新频繁且闭源生态中的公开代码库数量有限。

在 Xcode 中运行后,应用成功打开,首页推荐、音乐库分类(专辑/歌手/歌单)、迷你播放器均正常工作,还支持收藏功能。为规避版权问题,测试中使用了合成音乐,音质一般,但整体完成度已覆盖音乐播放器的核心功能。模型能生成可在Xcode中直接编译运行的完整应用,说明其对Apple开发生态的理解相当深入。
总结:编程性价比之王
综合本次八项测试,DeepSeek V4 Pro 0813 展现出了相当均衡的编程能力:
- 弱项:纯 SVG 动画的精细度略逊于 Kimi K3
- 强项:长文本理解、多轮搜索校验、复杂 3D 场景和游戏开发,部分场景(如飞船复刻、游戏细节)已反超 Kimi K3
最关键的是成本——完成全部5个复杂项目仅花费 5.36 元。在同等能力的模型中,DeepSeek V4 Pro 几乎是 API 价格最便宜的选择。对于需要大量调用、批量生成代码的开发者而言,这种「近乎接近顶级模型的能力 + 白菜价」的组合,使其成为多场景编程开发中极具吸引力的选项。从行业角度来看,DeepSeek的激进定价策略正在重塑开发者对AI编程工具的成本预期——当API调用成本降低到可以忽略不计的程度时,开发者可以更大胆地进行实验性开发,让AI尝试更多方案再从中筛选最优解,这种"廉价试错"的开发范式可能成为未来AI辅助编程的主流模式。
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
