DeepSeek V4-Pro深度解读:Agent能力升级、跑分实测与API涨价全分析

8月13号晚上,DeepSeek官方账号宣布 DeepSeek V4-Pro 正式上线,距离上一次的 V4-Flash 仅仅相隔两周。这次官方推文里主要传递了三件事:Agent 能力大幅升级、推理力度分三档可调、原生支持 OpenAI 的 Responses API。不过同时,还带来一个不太妙的消息——8月17号零点起,API 将全面涨价。
本文将结合官方跑分数据和第三方博主的分析,梳理 DeepSeek V4-Pro 到底强在哪、又为何说它「强归强、但没到碾压」。
DeepSeek V4-Pro 的三大核心升级
此次 V4-Pro 的核心卖点集中在 Agent 场景。Agent(智能体)是指能够自主感知环境、制定计划、调用工具并执行多步操作的AI系统,区别于传统的单轮问答模型。在AI行业中,Agent被视为大语言模型走向实际生产力的关键形态——它不只是回答问题,而是能像一个初级工程师那样完成复杂任务链。官方明确表示 Agent 能力得到大升级,同时推理力度支持三档可调,并原生支持 OpenAI 的 Responses API,这意味着对 Codex 等生态的兼容性进一步增强。
在推理档位设计上,V4-Pro 和 V4-Flash 都支持三档:简单任务可开 low 档省 Token,日常 Agent 工作流用中档,复杂任务则开 high 档拉满性能。推理力度(reasoning effort)的三档可调设计,本质上是让用户在Token消耗(即成本)与输出质量之间做取舍:低档跳过深度思考直接输出,适合格式转换等简单任务;高档则会触发完整的思维链推理,适合数学证明或多文件代码重构等需要反复验证的场景。官方表格的脚注里特别说明,代码 Agent 的跑分正是用最高档配合 Temperature 1.0 跑出来的——换句话说,榜单成绩是在最理想配置下取得的。
在 API 层面,V4-Pro 原生支持 OpenAI Responses API,并专门为 Codex 做了配置,上下文最长可达 384K,同时兼容 OpenAI 格式与 Anthropic 格式。OpenAI 的 Responses API 是其在2025年推出的新一代接口规范,取代了此前的 Chat Completions API,专门为Agent场景设计,内置了工具调用、文件读写、代码执行等原语。Codex 则是 OpenAI 基于该 API 构建的异步编程Agent产品,能在云端沙箱中自主完成代码编写、测试和提交。DeepSeek 原生兼容这套协议意味着,开发者无需修改已有的 OpenAI SDK 代码,只需将 base_url 指向 DeepSeek 的端点即可无缝切换,大幅降低了迁移成本。同时兼容 Anthropic 格式,则覆盖了另一大主流生态 Claude 的用户群。对于不想写代码的用户,网页和 App 里的 Expert Mode 用的就是 V4-Pro。
V4-Pro 跑分解读:十项全胜但难言碾压
要理解 V4-Pro 的实力,先得看懂官方那张跑分表里的一堆 Benchmark 都在测什么:
- HLE(人类终极考试):涵盖各学科超难题,斜杠前后分别代表「不让用工具」和「让用工具」两个分数;
- Terminal Bench:让 AI 在命令行里干活,装环境、跑脚本、修配置;
- NLR Repo:给一段需求描述,让 AI 从零生成一整个代码仓库;
- CyberGym:网络安全工坊;
- DeepSWE:修真实项目里的 Bug;
- Tulaflin:工具调用马拉松,一口气调一堆工具完成任务;
- Agent's Last Exam:可以理解为 Agent 版的终极考试;
- Automation Bench:考办公自动化。

V4-Pro 与 V4-Flash 跑分对比
和 V4-Flash 相比,V4-Pro 实现了十项全胜:Terminal Bench 87.9 对 82.7,DeepSWE 62.7 对 54.4,最难的 DS Bench Hard 67.2 对 59.6。而跟更早的 Preview 版比更是脱胎换骨——DeepSWE 从 12.8 直接飙到 62.7。
但如果要说「碾压」,还真算不上。Terminal Bench 输给了 Kimi K3 的 88.3,NLR Repo 落后于 Opus 4.8 的 69.7,DS Bench 的两项甚至连前二都没进。一句话总结:比 Flash 强一截,但没有达到大家期望中那种断层领先。
DS Bench 内部榜单暴露了什么
跑分表里有两个特殊项目——DS Bench,它们是 DeepSeek 自家的内部测试集,并不公开。据博主 Max4AI 的分析,DS Bench 分为 Fullstack(测完整全站开发能力)和 Hard(专门放高难度 Agent 任务),早在 6 月份 DeepSeek 就悄悄挂出了单独的榜单页面。
自建榜单在行业中并不罕见——Anthropic 有 SWE-bench、Google 有 BigBench——其优势是能精准衡量自家模型的目标能力,劣势则是公信力存疑。从实验室选择建什么榜,往往可以反推其技术路线的重心所在。

有意思的是,即便在自家榜单上 V4-Pro 也没能称王。Fullstack 榜上,Fable5 以 77.2 排第一,V4-Pro 71.1 仅排第四;Hard 榜上,Opus 4.8 的 71.7 反超 Fable5 的 68.3,V4-Pro 67.2 只排第三。连自己设计的榜单都没拿到第一,再次印证了「强归强、没碾压」的结论。
Max4AI 还提出了一个耐人寻味的观点:实验室自己造什么榜单,恰恰暴露了它在优化什么。DeepSeek 显然正在重点押注 Agent 及其配套的 Harness(此处指 DS-Harness)。Harness 在软件工程语境中通常指测试执行框架或评测沙箱,它规定了Agent如何接收任务、访问代码库、提交补丁以及如何被打分。如果 DeepSeek 将 DS-Harness 开源,意味着第三方可以在相同条件下复现和对比各模型的Agent表现,这将显著提升其榜单的可信度,同时也可能催生围绕该框架的开发者工具生态。剩下的悬念,是这套 DS Bench 是否会开源。(此观点为 Max4AI 单一来源的推测。)
DeepSeek API 涨价详解:分时定价策略全解析
相比模型能力,这次真正需要重点留意的是价格调整。

目前的价格是:V4-Flash 每百万 Token 输入 1 元、输出 2 元;V4-Pro 输入 3 元、输出 6 元。而从 8 月 17 号零点开始,DeepSeek 将改为分时定价——高峰时段为早 9 点到 12 点、下午 2 点到 6 点。
分时定价(time-of-use pricing)借鉴了电力行业的峰谷电价机制。对于GPU密集型推理服务而言,高峰时段的算力利用率接近100%,每一次请求都可能排队等待空闲GPU,边际成本极高;而凌晨时段大量GPU闲置,边际成本趋近于零。通过价格信号引导用户错峰,既能平滑负载曲线、降低扩容压力,也能让价格敏感型用户享受更低费率。这一策略在云计算领域已有先例,如AWS的Spot Instance和Google Cloud的Preemptible VM,但在大模型API定价中尚属少见,DeepSeek此举可能引发行业跟进。

高峰时段涨幅一览
新价格下,高峰时段涨幅相当惊人:
- Flash 输出:涨到 9 元,是现在的 4.5 倍;
- Pro 输出:涨到 27 元,同样约 4.5 倍;
- 最夸张的是 Pro 高峰时段的缓存命中输入:从 2 分 5 涨到 3 毛,涨了约 12 倍。
如何降低使用成本
好消息是,空闲时段一律半价。因此如果你要跑批量任务,尽量安排在夜里执行,能省下不少成本。这一「高峰劝退、空闲鼓励」的分时策略,本质上也是在引导用户错峰使用,缓解高峰期的算力压力。对于企业用户而言,可以考虑将非实时的回归测试、数据标注、文档生成等任务通过任务队列调度到凌晨执行,充分利用低谷费率。
总结:V4-Pro 值得升级吗
综合来看,本期信息量相当集中:DeepSeek V4-Pro 已经上线,比 Flash 强一截,但别指望它碾压顶级对手;推理三档按钮可以按需调节;8 月 17 号起涨价,高峰输出贵 4.5 倍,跑批量任务尽量挪到夜里。
从 DeepSeek 密集造榜、押注 Agent 与 Harness 的动作来看,这家实验室正在把重心明确转向 Agent 生态。而即将发布的 DS-Harness,或许才是这盘棋真正的关键落子。
核心要点
相关推荐

切片Wasserstein距离提升分类可分性:实验与反思
探索用切片Wasserstein距离(SWD)学习特征变换以增大类间分布距离的实验。分析为何该方法对决策树有效却对其他分类器失败,揭示分布度量与分类器匹配的深层问题。

Gemini 3.6 Flash深度测评:速度提升背后的算力焦虑与价格真相
深度分析Gemini 3.6 Flash的真实性能表现:智力指数原地踏步但速度翻倍,Token效率大幅提升,多模态能力进步明显。结合海外开发者社区实测反馈,揭示3.5 Pro跳票背后的算力瓶颈、价格战困境与多Agent架构的工程现实。

Bun 1.4 Rust重写引质疑:性能与稳定性隐忧分析
Bun 1.4版本引入Rust重写部分核心模块,社区对性能回退和稳定性表示担忧。本文分析从Zig到Rust迁移的技术风险、开源项目重构困境,以及开发者应如何应对基础设施工具的技术栈变更。