DeepSeek Harness实测:国产版Codex编程能力对标Claude

DeepSeek 补齐拼图:Harness 究竟是什么
DeepSeek 昨天连放两个大招——V4 Pro 正式版上线,紧接着万众瞩目的 DeepSeek Harness 开源。GitHub 仓库上线不到一天就冲上了 8 万多 Star,AI 界顶流的号召力可见一斑。
那么,Harness 到底是什么?这个词翻译过来是「驾驭」。如果把 AI 模型比作一匹马,Harness 就是你驾驭这匹马所需要的一整套装备:你写的项目规则文件、配置的各种工具、安排的任务拆分与执行顺序、设计的测试检查流程,这些统统都算 Harness。
这里有一个很精妙的公式:Agent = Model + Harness。模型负责思考和生成,Harness 负责把这些能力接入文件系统、终端、网页和工具链,让 AI 真正能在现实环境里干活。这个公式源自 AI Agent(智能体)领域的核心设计范式——在学术界和工业界,一个能自主完成任务的 AI Agent 通常由感知层(接收输入)、决策层(模型推理)和执行层(工具调用与环境交互)三部分构成。Model 负责决策层的推理和生成,而 Harness 则涵盖了感知层和执行层,包括文件系统访问、终端命令执行、API 调用、任务编排等基础设施。此前业界常见的做法是将这些能力硬编码在 Agent 框架中(如 LangChain、AutoGPT),而 DeepSeek 将其抽象为可插拔的 Harness 层,代表了一种更模块化的 Agent 架构思路。此前 DeepSeek 只开源了模型这一半,Harness 一直没动静,这次终于补齐了。
你可以把 DeepSeek Harness 理解成一个高度可定制的 AI 编程工具,对标 Claude Code 和 Codex。但它的野心更大——不只是一个编程 Agent,而是一套可配置、可重组的 Agent 运行环境,官方口号是「一切皆插件」。
DeepSeek Harness 安装教程:一分钟上手
安装过程非常简单。首先确保电脑已安装 Node.js 环境(没有的话去 Node 官网下载傻瓜式安装包即可)。Node.js 是基于 Chrome V8 引擎的 JavaScript 运行时,它让 JavaScript 得以脱离浏览器在服务端运行,是现代前端工具链和全栈开发的基础设施。然后进入 DeepSeek Harness 官网,复制那行安装命令,在终端执行。
稍等片刻,终端会输出一个网址,打开它就能进入 Harness 的 Web 界面。首次使用需要填入 DeepSeek 的 API Key——去开放平台创建一个,复制粘贴进来即可。API Key 是大模型服务商用于身份认证和用量计费的密钥,每次 AI 调用都会通过这个密钥向 DeepSeek 的云端 API 发送请求并按 token 计费。到这里就算安装成功了。
进入界面后选择一个想让 AI 操作的项目文件夹就能开始干活。你可以在对话框中选择模型和推理等级,还能设置 Agent 对文件系统和终端的操作权限。默认使用标准模式,它具备了一个 AI 编程工具应有的全部能力,大多数情况下够用了。

整个界面与 Codex 高度相似,可以把它当成「国产版 Codex」来用,AI 编程、自动化办公这些任务都能搞定。
四个实战任务:DeepSeek Harness 编程能力实测
代码理解与架构图生成
第一个任务是让 Harness 分析自己的代码仓库并绘制架构图。仓库不小、模块也多,正好考验代码理解能力。AI 自动读取文件、分析结构,执行速度很快,每一步在做什么都清晰展示在界面上。最终输出了 Mermaid 绘图语法,渲染后架构图内容比较完整。
Mermaid 是一种基于文本的图表绘制工具,允许开发者用类似 Markdown 的简洁语法来定义流程图、时序图、类图等多种图表类型。它的核心优势在于「代码即图表」——不需要使用 Visio 或 Draw.io 等图形化工具,直接在文本中描述节点和连线关系,渲染引擎就能自动生成可视化图表。Mermaid 已被 GitHub、GitLab、Notion 等主流平台原生支持,AI 生成 Mermaid 语法而非图片格式,意味着输出结果可以被版本控制、轻松修改和二次编辑。
值得一提的是它的轨迹面板——可以清晰查看整个对话中每一次的工具调用记录,让每次运行都有迹可循,这是 Harness 的一大特色。
交互式动画网站开发
第二个任务是开发一个用交互式动画讲解知识的网站。大约 20 分钟完成,主要时间花在 AI 的自我检查上。让人惊喜的是这次任务的缓存命中率达到 99%,实际花费极低。
这里的「缓存命中率」是衡量大模型 API 调用成本的关键指标。当用户向大模型发送请求时,输入的 prompt 中往往包含大量重复内容(如系统提示词、项目上下文、之前的对话历史)。大模型 API 提供商会对这些重复前缀进行 KV Cache 缓存——如果当前请求的前缀与之前某次请求匹配,就可以直接复用已计算的中间结果,而非重新计算。缓存命中的 token 通常按原价的 1/10 甚至更低收费。DeepSeek Harness 在执行多步任务时,每一轮对话都会携带完整的项目上下文和历史记录,这些内容高度重复,因此缓存命中率能达到 99% 以上,大幅降低了实际使用成本。
成品动画生动、连线准确,还提供了总结和小测验功能,效果明显优于此前用 V4 Pro + Codex 跑出来的版本。
3D 游戏与手势控制
第三个任务难度升级:开发一个支持摄像头手势识别控制的 3D 网页小游戏。这类项目通常涉及 WebGL/Three.js 进行 3D 渲染以及 MediaPipe 或 TensorFlow.js 进行手势识别,技术栈跨度大、集成难度高,是检验 AI 全栈编程能力的理想场景。这次跑了将近 40 分钟,缓存命中率接近 100%。成品可以鼠标拖拽旋转,甚至开启摄像头「搓手」控制旋转,连影子细节都做得很到位,交互体验被评为「顶级」。

全栈 AI 网页 PPT 生成器
第四个任务是开发一个内置大模型调用能力的全栈 AI 网页 PPT 生成器:用户粘贴长文案,后端调用 DeepSeek 拆解为多页 PPT,前端渲染成可全屏演示的网页。执行中 AI 会主动向用户确认权限,安全性到位。这种「人在回路中」(Human-in-the-Loop)的交互设计是 AI 安全领域的最佳实践——确保关键操作(如文件删除、系统命令执行、网络请求等)在用户明确授权后才执行,有效防止 AI 的自主行为造成不可逆的后果。约半小时完成,成品支持自定义风格、开启推理模式、切换主题配色,布局主次分明。这一版的表现「可以和 Claude 媲美」。
关于费用:这几个任务跑下来花费不到 5 元,得益于 99% 以上的缓存命中率。不过需要注意 DeepSeek 已宣布涨价且幅度不小,但对比 Claude 仍然便宜很多。
DeepSeek Harness 四种运行模式详解
Harness 提供 4 种运行模式,适配不同场景,其本质区别就是当前会话加载了哪些工具插件:
- 标准模式:叠满全套能力,包含文件编辑、执行命令、网页搜索、子 Agent、Skills 技能等,覆盖日常开发所有需求,绝大多数情况用它就好。子 Agent 是指在主 Agent 的任务执行过程中,将特定子任务委托给独立的 Agent 实例去处理,类似于编程中的函数调用——主 Agent 负责任务拆解和结果汇总,子 Agent 专注执行细分领域的工作,这种分治策略能显著提升复杂任务的完成质量。
- 极简模式:只保留 Bash 和文件编辑两件最基础的工具,主要用于官方跑模型基准测试(如 SWE-bench、HumanEval 等业界标准编程评测),在最小环境下考验模型的纯编程能力,排除工具链增强带来的干扰因素。
- PTC(程序化工具调用)模式:普通模式下 AI 一步步调用工具,而 PTC 模式让模型直接生成一段 TypeScript 代码把多步工具调用串联起来一次执行。TypeScript 是 JavaScript 的超集,增加了静态类型系统,在现代开发中被广泛采用。在 PTC 模式中,AI 不再逐步发出单个工具调用指令并等待返回结果,而是编写一段完整的脚本来编排多个操作的执行顺序和逻辑分支,类似于从「逐条发送命令」升级为「编写并执行批处理脚本」。这种方式适合步骤多、逻辑清晰的任务,如批量重命名文件、跑自动化流程,因为减少了模型与工具之间的多轮交互延迟。
- 创造模式:继承标准模式全部能力,还能让 AI 检查当前运行时有哪些插件、在内存里试验新插件组合,甚至自己创作出全新的模式预设。这种「AI 自我进化运行环境」的能力,在 AI Agent 研究中被称为自适应(Self-Adaptive)能力,是通向更高级自主智能体的重要一步。

杀手锏:一切皆插件的架构设计
Harness 与 Codex、Claude Code 最大的区别在于它的插件系统。在这里,模型、工具、技能、会话、沙箱、UI,甚至 Agent 的运行循环本身都是插件。
「一切皆插件」(Everything is a Plugin)是一种极致的微内核架构设计哲学,其思想可以追溯到操作系统领域的微内核(Microkernel)理念——系统核心只保留最小化的调度和通信机制,所有功能模块都以可插拔的服务形式存在。在软件工程中,Eclipse IDE、VS Code、WordPress 等成功产品都采用了类似理念。DeepSeek Harness 将这一架构推向了 AI Agent 领域的极端——不仅工具和 UI 是插件,连 Agent 的核心运行循环(即模型如何循环调用工具、如何决定何时停止)本身也是插件,这意味着用户可以从根本上重新定义 AI Agent 的行为逻辑,而不仅仅是扩展其外围能力。
也就是说,任何地方不满意都可以随时替换或安装插件扩展,无需改动框架源码。
社区插件安装与推荐
在官网点击「社区插件」就能看到 GitHub 上打了 dsh-plugin 标签的所有项目。安装极其简单——把插件开源地址提供给 AI 让它帮你装即可。社区里有各种趣味皮肤插件(鲸鱼娘美化、Excel 表格皮肤、终端皮肤等),也有真正实用的功能插件。

最值得关注的是 Modelance 视觉插件,可以帮助文本模型理解图片内容。这个插件的意义在于,DeepSeek 的文本模型本身不具备多模态视觉能力,而 Modelance 通过调用外部视觉模型(如 GPT-4o 或其他视觉 API)对图片进行分析,再将描述结果以文本形式传递给 DeepSeek,从而曲线实现了「看图理解」的能力。这些插件补齐了 Harness 在交互细节和能力上的不足,也侧面印证了「一切皆插件」架构的灵活性。
如何开发自己的 Harness 插件
自己写插件也很容易,直接让 AI 帮你写。切换到创造模式,跟 AI 提需求即可——比如把 Codex 上用过的桌宠插件搬过来。AI 开发完会先请你人工审批,确认无误后才正式安装。这一机制体现了沙箱(Sandbox)安全隔离的设计思想——沙箱将程序的执行限制在一个受控的环境中,防止其对宿主系统造成意外或恶意的影响。在 AI Agent 场景中这尤为重要,因为 Agent 可以自主执行代码、修改文件、运行终端命令,如果没有适当的隔离和审批流程,错误操作可能对系统造成不可逆的损害。你还可以发挥想象做定时喝水提醒、实时显示模型账户余额的悬浮窗等各种插件,并通过 GitHub 推送分享给他人。
总结:DeepSeek Harness 值得用吗
综合几次测试,DeepSeek Harness 的整体感受是:速度尚可,缓存命中率极高,执行过程清晰透明——你能看到 AI 每一步在做什么、调用了哪些工具、读了哪些文件,不像有些工具暗箱操作。这种透明性在 AI 安全和可解释性(Explainability)领域被高度重视,它让用户能够审计 AI 的决策过程,及时发现并纠正错误,建立对 AI 系统的信任。
从实测来看,DeepSeek V4 Pro 配合自家 Harness 的编程能力确实可以对标 Claude。这也说明官方那个只差 0.1 的跑分背后,Harness 工具的适配至关重要——用 DeepSeek 模型还是得用自家的 Harness。这一现象在 AI 领域并不罕见:模型的基准测试(Benchmark)成绩很大程度上取决于评测时使用的系统提示词、工具配置和执行策略等「工程包装」,而非模型的纯裸能力。Harness 作为官方针对自家模型深度优化的运行环境,在提示词工程、工具调用格式、上下文管理等方面都做了精细适配,因此能充分释放模型潜力。
更进阶的玩法还有很多:命令行模式批量跑任务、接入切换其他大模型、自定义 Agent 预设、部署到服务器供团队共享等等。但真正让人兴奋的,是「开源 + 一切皆插件」带来的极致开放性——也许用不了多久,我们每个人手里的 AI 编程工具都会长得不一样,因为每个人都能根据自己的需求自由组装。这,是一件很酷的事情。
相关推荐

儿童AI机器狗开发实战:多模型路由、内容过滤与延迟优化
一款售价130美元的儿童AI机器狗,集成8个大语言模型与61种语言语音交互。团队分享了内容安全过滤层、多LLM意图路由、响应延迟优化到1秒以内等关键工程经验,为AI硬件产品开发者提供实战参考。

Omarchy能否主导千元以下轻薄本市场?深度解析
Omarchy基于Arch Linux的轻量系统,在千元以下笔记本市场展现独特优势。本文对比Windows和MacBook在低配硬件上的性能瓶颈,分析Omarchy为何能让廉价笔记本流畅运行,以及它面临的生态挑战与市场前景。

AI Agent零基础入门:打造创意策略智能助手
从零构建创意策略AI Agent完整指南。无需编程基础,用Dify、Coze等工具快速搭建智能助手。涵盖Agent概念、提示词工程、RAG知识库、工具调用等核心技术,帮助创作者实现AI创意策略落地。