DeepSeek Harness深度解析:40小时10万Star背后的技术架构与战略野心

DeepSeek Harness以极致插件化设计爆红,重新定义了AI Agent的「驾驭层」范式。
DeepSeek Harness是一个发布后40余小时冲破10万Star的开源项目,其核心定位是模型与操作系统之间的「驾驭层」。它最大的亮点在于极致的可插拔设计——连官方内置工具、Agent Loop本身都可按统一标准替换,甚至能自我修改,短期内催生了数千个社区插件。文章通过三位嘉宾的深度拆解,梳理了Harness与Skills的区别、Web UI背后的可观测性价值、「极简模式」的实测表现,以及算力作为「Agent公式第三极」的战略地位。嘉宾们对「99%缓存命中率」等传说持审慎态度,认为这是合理的提示词工程而非黑科技。整体判断是:DeepSeek Harness的野心在于构建一个极致开放、社区共建的通用Harness平台。
引言:一个新物种的爆火
DeepSeek 又一次成为技术社区的焦点。这一次不是模型本身,而是与之配套的 DeepSeek Harness——一个在发布后 40 多个小时便冲到 10 万 Star 的开源项目。这个速度甚至超过了当年 Open Interpreter/OpenCloud 类工具的历史记录。
在一场围绕 DeepSeek Harness 的直播中,昇腾看社区核心开发者阿俊、参与内测的开源作者阿江,以及 AI 编程博主主持人,一起拆解了这个新物种究竟是什么、为什么爆火、以及它背后的战略野心。本文结合这场深度交流,梳理 DeepSeek Harness 的核心逻辑与判断。
Harness到底是什么?模型的驾驭层
业界流传着一个来自 DeepSeek 的公式:Agent = 模型 + Harness。如果说模型是「大脑」或「大佬」,那么 Harness 就是让这位大佬真正干活的那套工具和身体。
阿江对此的理解很直接:Harness 是模型和我们日常操作系统之间的驾驭层,它包括提供给模型的工具、技能、文件系统、沙箱等一切基础设施。而阿俊则在公式后面补了一环:Agent = 模型 + Harness + 算力。他强调,没有充足的算力供给,再好的 Harness 和模型也跑不起来——「模型是大脑,Harness 是身体,而算力是打地基的土木工程」。
与 Cloud Code、Codex 这类成熟商业产品相比,DeepSeek Harness 目前仍处于开发者预览阶段,对小白用户不算友好,但它有一个别人没有的特质,这也是它的野心所在。
「Harness」一词来源于马具/驾具,原指套在马身上用于驭马的装具,在软件领域常指「测试框架」(Test Harness),即将被测对象套入一套标准化脚手架中运行。DeepSeek 借用这一概念,将其定义为包裹并驱动模型的运行时框架——与 LangChain、AutoGen 等编排框架的核心区别在于:Harness 强调的是与特定模型深度协同的「专属适配层」,而非通用的多模型调度抽象。此前业界类似的概念还包括 Anthropic 的 Claude Computer Use 框架、OpenAI 的 Codex CLI 等,但这些工具均未将框架本身完全开源并实现插件化。DeepSeek Harness 的定位更接近操作系统的 shell 加上包管理器的组合:shell 负责接收指令并调度工具,包管理器则让工具本身可以随时热插拔替换。
一切皆插件:自己扯自己头发上天
阿江在直播中反复提到一个让他震撼的点:这是第一次见到 Harness 工具能自己改自己。
「有一种自己扯着自己头发上天的感觉。」
在 DeepSeek Harness 的页面上,你可以原地生成一个插件,原地部署,甚至改变它自己的界面。更关键的是,它没有把任何东西焊死——不仅是普通插件,连官方内置的模型工具、绘图能力,甚至 Agent Loop 本身,都可以按照同一套插件标准去替换。
这种极致的可插拔设计,配合开源,把二次开发和商业化的落地成本大幅降低。阿俊补充道,模型现在是一个「卷成麻花」的行业,几乎每个月刷新一次,模型变得这么快,对应的 Harness 也必须跟着变。DeepSeek Harness 的聪明之处,就在于它把「模型变快、Harness 必须变」这个逻辑推演到了极致——把所有东西都做成可插拔,从而精准命中了社区当下的需求。
这也解释了为什么短短几天内就涌现出七八千个插件,某个插件汇总网站精选收录的就有上千个。
插件与Skills的核心区别
直播中有观众追问插件和 Skills 的区别。三位嘉宾的共识是:
- Skills 是一套跨平台的通用标准,任何人都能创造,本质是知识管理和上下文管理的手段,是给模型用的;
- 插件 则专注于解决具体应用场景问题,是按 DeepSeek Harness 自己那套标准开发的代码,范围要广泛得多——比如一个纯美化的皮肤插件,完全不影响与 AI 的交互。
此外,DeepSeek Harness 的插件系统据说基于 Claudius 技术实现,支持容器化运行。它不仅能热插,还能热拔——卸载插件时,之前注册的工具、服务会自动取消,就像从没装过一样,这是许多传统 IDE 插件做不到的。
Claudius 是一种基于 WebAssembly(WASM)或容器沙箱的插件运行时规范,其核心设计目标是隔离性与可移植性——插件在独立的沙箱中运行,无法直接访问宿主进程的内存,既保证安全性,也使得「热插拔」在技术实现上成为可能。传统 IDE 插件(如 VS Code Extension)通常运行在同一个 Node.js 进程内,卸载时残留的事件监听器和全局状态往往需要重启 IDE 才能清除。而容器化的插件生命周期完全由运行时托管,注册的工具描述(Tool Schema)和 HTTP 端点在容器停止时自动注销,这正是 DeepSeek Harness 宣称「卸载即消失」的技术基础。这一机制也意味着插件开发者可以用任意语言编写后端逻辑,只需暴露符合规范的接口,大幅降低了社区开发者的入门成本。
极简模式与模型深度协同之谜

社区流传一个说法:DeepSeek Harness 是 V4-Pro 模型的「角色专属」,在 Harness 框架下能激发模型最大性能。这是真的吗?
嘉宾的态度相当审慎。阿江和阿俊都表示,在 benchmark 上没有观察到明显的性能提升。但阿俊分享了一个有趣的观察:DeepSeek 模型的「性格」确实不太一样——它更倾向于用简单方式解决问题,甚至会跳过它认为过于复杂的工作流。这让他联想到某些模型的「毛坯房模式」,猜测 Harness 与模型之间可能做了深度协同。
他还引用 Kimi K3 论文作为交叉佐证:为了避免模型对 Harness 过拟合,论文中提到组合了各种 Harness 工具调用来生成训练轨迹。这说明 Harness 的行为确实可能与模型产生深度耦合。
关于备受关注的极简模式,阿江指出重点在「少而稳定」:提示词极短,只暴露两个工具(bash 和文本编辑器),不注入运行时上下文,也不做压缩。主持人实测发现,极简模式做任务的速度比标准模式快约三分之一,效果与标准模式相当,有时更好、有时略逊。但它是否真能发挥 DeepSeek 最大性能,嘉宾一致认为「把时间交给官方」。
Web UI与可观测性的巧思

为什么 DeepSeek Harness 选择 Web UI 而非 CLI 或桌面端?两位嘉宾从不同层面给出了答案:
- 从易用性角度(阿江):Web UI 比命令行小黑窗更容易被新手和非程序员接受,且不用处理多平台兼容性问题;同时 Web 前端技术栈让插件开发门槛极低。
- 从专业性角度(阿俊):Web UI 中一个极其重要的页面是思维链的思考过程和交互细节。在昇腾看社区的真实生产任务中,一个 8~36 小时的长任务失败时,错误起点可能藏在很早的某一轮对话里,因此可观测性是刚需。看到 DeepSeek 把这个能力做成标准入口,他感到「非常惊喜」。
主持人补充道,以往用 Cloud Code 时根本不知道实际给大模型发送了什么,而 DeepSeek Harness 让每一步注入的系统提示词、调用的工具、传的参数、花费的 token 都一目了然,这是它极受专业开发者喜爱的原因。
值得一提的是,由于 Web 开发成本低,GitHub 上已经涌现出一大堆「包壳」的 DeepSeek 桌面端项目,官方大概率不会亲自去做桌面端。
算力生态:Agent公式中被忽略的第三极

在 Agent = 模型 + Harness + 算力 的公式中,算力是阿俊最想强调的一环。作为昇腾看社区的核心开发者,他所在的 kanbot 项目正是「用 Agent 写算子、做性能优化」的算力基建工作。

他还科普了「算子」这一概念:PyTorch 模型由大量原子计算(加减乘除、张量运算等)组成,硬件厂商会把这些计算封装成算子,运行在 NPU、GPU 等硬件上。算子就是数学应用层落到硬件上的载体。
阿俊提出了一个更宏观的判断:模型不仅能自己改 Harness,未来还能优化算力——它可以过来优化算子性能、融合计算结构。因此算力也是模型自我进化的重要一环。他还乐观地指出,国产模型在算子优化这类冷门但硬核的赛道上进步显著,昇腾看社区已将算子知识全面开源为 Skills 和插件,为模型提供了英伟达生态所没有的开源语料细节。
「算子」(Operator/Kernel)是深度学习框架与硬件之间的关键桥梁。以矩阵乘法为例,PyTorch 调用 torch.matmul() 时,底层会分发到针对具体硬件优化的算子实现——英伟达 GPU 上对应 cuBLAS/cuDNN 库,华为昇腾 NPU 上则对应 CANN(计算架构)中的算子库。算子的性能直接决定模型训练和推理的吞吐量,一个优化良好的算子可以比朴素实现快数倍至数十倍。算子开发长期依赖人工手写 CUDA/算子 DSL 代码,是高度专业化的工作。近年来,编译器自动调优(如 TVM、Triton)和 AI 辅助算子生成逐渐成为研究热点。昇腾看社区所做的「用 Agent 写算子」,正是探索让 LLM 自动生成和优化特定硬件的底层计算代码,属于「AI for Systems」方向的前沿实践,在国产硬件生态建设中具有重要意义。
缓存命中率99%:并非黑科技
关于「DeepSeek Harness 缓存命中率可达 99% 甚至 100%」的传闻,三位嘉宾态度一致:这并非独有黑科技。缓存命中率的本质是比对每轮提示词的请求前缀,只要前缀相同即可复用缓存、减少重复计算成本。跑的人数越多,分子分母算出来的比例就越高。核心还是提示词设计得当,以「模型亲和」的方式组织上下文——它确实能省钱,但不算复杂技术。
此处的「缓存」指大语言模型推理服务中的 KV Cache(键值缓存)。Transformer 模型在处理每个 token 时,都需要计算其与所有历史 token 的注意力权重,这些中间结果(Key 和 Value 矩阵)可以被缓存复用。当新请求的前缀与已缓存请求完全一致时,服务端无需重新计算这部分,直接读取缓存即可,从而节省大量算力和延迟。对于 Agent 场景尤为重要:系统提示词(System Prompt)通常占据几千甚至上万 token,若每轮对话都重新计算,成本极高。DeepSeek Harness 通过将系统提示词和工具描述固定在前缀部分、将动态对话内容追加在后,使得每轮请求都能最大化复用之前的 KV Cache。这本质上是一种提示词工程规范,而非服务端的专有技术,任何推理框架(vLLM、SGLang 等)都支持类似机制。
开源共建与国产Harness的崛起
为什么 DeepSeek 要开源 Harness?嘉宾的共识是:这既符合 DeepSeek 一贯的开源理念,也是促进整个 AGI 生态发展的策略。模型都已开源,Harness 若不开源,社区反而会分散精力做各种类似工具(如 Pi Agent)。开源让社区共建,项目价值最大化,同时 DeepSeek 自己得以专注打磨模型。
阿江分享的内测故事尤其动人:群里一群二次元头像、甚至不止一个高中生,所有人都在 Web Coding 写插件、通宵开语音,「有种一起创业、见证国产 Harness 崛起的感觉」。
给程序员的建议
三位嘉宾也给程序员一个共同的建议:不必焦虑,AI 是快速变化的实践学科,真正不变的是定义需求的能力、验收成果的判断力和业务经验。未来每个程序员都需要具备「Harness 思维」,把行业经验沉淀为 Skills、Tool 和插件,而「品位」将成为越来越重要的护城河。
DeepSeek Harness 的野心,或许不止于做一个编程助手,而是打造一个极致开放、社区共建的通用 Harness 平台——就像给了大家一种玩开放世界游戏的创造快乐。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。