DeepSeek Harness实测:插件化Agent编码新标杆

DeepSeek近日正式发布了V4 Pro模型的同时,还带来了一个更值得程序员关注的产品——DeepSeek Harness,一套完全属于自己的代理编码(Agentic Coding)系统。代理编码是指AI系统不仅仅完成单次代码生成,而是像一个自主开发者那样,能够规划任务、分步执行、调用工具、读写文件、运行测试并根据结果自我迭代的编程范式。与传统的代码补全相比,代理编码强调的是端到端的任务完成能力——从理解需求到交付可运行的完整项目。2024年以来,Claude Code、Cursor Agent、Codex等产品相继推出,标志着这一范式从实验走向主流。相比模型本身的迭代,这套开发者预览版的Harness框架在设计理念和实际体验上都展现出了不小的野心。本文基于一位技术博主的深度实测,梳理这套系统的核心亮点与真实表现。
DeepSeek V4 Pro模型升级:性价比仍是最大杀手锏
DeepSeek此次将V4系列定位为「重大的智能体升级」。代理编码近来一直是国产大模型的兵家必争之地,V4 Pro也不例外,同时还为Flash版本引入了灵活的推理努力(reasoning effort)选项,并新增对OpenAI Responses API的支持。
推理努力是近期推理模型中引入的一项重要参数,允许用户在调用时指定模型投入多少计算资源进行思考。高推理努力意味着模型会进行更长的思维链推理,适合复杂数学或编程问题;低推理努力则快速给出答案,适合简单查询。这一设计的本质是在延迟、成本和质量之间给予用户灵活控制权,避免对所有请求一刀切地分配相同计算预算。而DeepSeek选择兼容OpenAI Responses API这一新一代接口标准(支持工具调用、多轮对话状态管理和流式输出等代理化特性),意味着现有基于OpenAI生态构建的应用和框架可以较低成本切换到DeepSeek后端,这是一种典型的生态借力策略。
从独立基准测试来看,V4 Pro整体排名第八,落后于几天前发布的Qwen3.8 Max,但需要注意的是,它的参数规模远小于Kimi K3或Qwen3.8这类模型。博主评价它更像是「与Kimi K3对齐」而非对标GPT-5级别的模型。
值得一提的是价格变化:DeepSeek此次涨价幅度达到2到4倍。但即便如此,它在前沿级模型中依然保持着极具竞争力的定价,处于成本与性能权衡的最佳前沿。这也从侧面反映出各大实验室普遍面临算力紧张的现实,DeepSeek也不例外。

Harness的核心理念:一切皆插件
DeepSeek Harness目前仍处于开发者预览阶段,官方也坦言会有不少粗糙之处,但其设计哲学相当前卫——一切都作为插件处理,包括工具、技能乃至绘图功能。
高度可组合的插件化架构
这种插件化设计意味着开发者可以自由混合、搭配、替换甚至扩展不同功能。插件化架构在软件工程中有悠久历史,从Eclipse IDE到VS Code都采用了类似设计。在AI代理领域,插件化意味着每个能力(文件操作、终端执行、Web搜索、代码分析)都被封装为独立模块,通过统一接口注册和调用。这种设计的最大优势是可组合性——开发者可以根据任务需求灵活组装能力栈,甚至将第三方代理作为子模块嵌入,形成多智能体协作拓扑。
更有意思的是,你甚至可以把其他编码代理(如Claude Code)当作插件来调用,从而基于这个框架构建多智能体系统。DeepSeek在配套论文中阐述了这套「面向可组合性的编程方式」的完整理念。
安装体验也相当顺畅。博主直接克隆仓库后从源码安装,随后可启动一个本地Web应用(默认运行在3018端口)。这个Web应用界面设计精致,首次登录后填入DeepSeek API密钥即可开始使用。

灵活的工作模式与权限体系
设置好工作区(本质是一个项目文件夹)后,用户可以选择多种工作模式:具备文件编辑、Web搜索和完整编码能力的完整模式、代码模式、机械模式,以及可自定义配置文件和智能体的创作者模式。
权限管理提供了只读、工作区写入、完全访问四档,其中「完全访问」相当于此前Claude Code那种跳过确认的危险模式。整个框架采用MIT许可证——这是最宽松的开源许可证之一,允许任何人自由使用、修改、分发代码,包括商业用途,唯一要求是保留原始版权声明。相比部分竞品采用的AGPL或自定义许可证,MIT许可在商业场景中几乎没有合规负担,因此引入其他模型(包括本地部署版本)门槛很低。所有配置都集中在一个YAML文件中管理,Web搜索插件在提供DeepSeek密钥后会自动启用。
编码实测:2000万token完成ISS实时追踪器
为了检验Harness的真实能力,博主设置了一个测试任务:为国际空间站创建一个实时追踪器,要求每5秒轮询一次API端点以获取实时数据。
速度与缓存命中率表现亮眼
无论是Flash还是Pro版本,运行速度都相当快。界面底部会实时展示详尽的运行信息,包括每秒token数、缓存命中率、轮次数量、运行时间等——这一点尤其值得称赞,因为很多同类工具会刻意隐藏这些数据。
实测中,token生成速度达到每秒112至130个,而最令人印象深刻的是缓存命中率高达95%至100%。在大语言模型推理中,KV Cache(键值缓存)是存储已计算注意力键值对的机制。当多轮对话中前缀内容不变时,缓存可以避免重复计算,大幅降低延迟和成本。95%-100%的缓存命中率意味着Harness在构造prompt时极为精心地保持了前缀稳定性——这需要在系统提示词、上下文管理和工具输出的拼接顺序上做大量工程优化。对于代理编码这种动辄数十轮交互的场景,高缓存命中率直接决定了响应速度和最终费用。博主直言这是他近期见过的最优秀的缓存设计之一,DeepSeek在这方面确实下了功夫。

输出质量超出预期
整个任务耗时约35分钟,经历两轮迭代(中途需人工介入修复一个小问题),最终消耗了惊人的2000万token,输出token约24万。尽管token消耗量确实偏高,但输出质量令博主刮目相看。
这个空间站追踪器不仅位置追踪准确(与实时数据对比几乎完全吻合),视觉效果也相当出色。系统通过多轮尝试选定了合适的着色器来渲染地球,甚至连太阳相对地球的位置都是正确的——测试时正值美国白天,输出画面也如实反映了这一点。这类细节此前一直是DeepSeek模型的短板,而借助Harness却得到了明显改善。

DeepSeek Flash vs Pro:编码任务如何选择
一个有趣的发现是,博主在编码任务上更倾向于Flash版本而非Pro版本。尽管Pro相比上一代是重大升级,且整体定价极具竞争力,但Flash在投资回报率上表现更佳——价格便宜得多,实际编码效果却不逊色。因此对于代理编码任务,博主强烈推荐优先尝试Flash版本。
一个值得注意的开发细节
据博主提及,DeepSeek Harness本身是在Codex的大量协助下开发出来的,至少20%的提交和拉取请求来自Codex工作流。这也解释了为何它的界面和交互风格与Codex高度相似——待办事项列表逐项推进的体验几乎如出一辙。这一现象本身也反映了当前AI工具开发的有趣趋势:AI代理正在被用来构建下一代AI代理,形成一种自举式的开发循环。
当前局限与未来展望
尽管整体体验令人满意,Harness也暴露出DeepSeek开放模型的老问题:token效率偏低。Token效率是指完成相同任务所需消耗的token数量。开源模型和部分国产模型在这方面普遍弱于Claude和GPT系列,原因包括:训练数据中代码比例和质量差异、指令跟随能力导致的冗余输出、以及代理循环中缺乏有效的早停机制。2000万token完成一个中等复杂度项目意味着成本虽然单价低但总量不小,这也是为什么DeepSeek在涨价后仍需关注效率优化的重要原因。博主期待后续迭代能在token效率上有所提升。
此外,多模型支持尚未到位,一旦补齐将大幅提升这套框架的想象空间。而由于Harness是可自行部署的Web应用,理论上可以部署到云端,实现随时随地访问自己的编码代理——这是一个颇具吸引力的方向。博主也提到,V4 Flash可以在自有的DGX设备集群上本地运行,效果相当不错。DGX是NVIDIA推出的专为AI训练和推理设计的高性能计算系统,单台配备多块顶级GPU,能够本地运行大规模语言模型而无需依赖云端API,这对于对数据隐私有严格要求的企业场景尤为重要。
总的来说,DeepSeek Harness以插件化、可组合的设计理念,加上出色的缓存表现和透明的运行统计,为代理编码工具树立了一个新标杆。虽然仍处早期预览阶段,但已足够让人期待它的正式版本。
核心要点
相关推荐

DeepSeek Harness保姆级教程:插件化AI Agent实战指南
详解DeepSeek Harness安装配置、四种Agent预设模式、第三方模型接入及插件管理,附带个人博客和任务管理应用两个实战案例,手把手教你搭建插件化AI Agent。

Gemini决策闭合基准实测:285次运行99.3%通过率解读
一份聚焦LLM决策闭合能力的基准测试,285次实测中Gemini取得99.3%语义通过率。本文解析其方法论亮点:语义正确与格式合规的分离评分,以及冻结基准跨模型对比的实验设计。

Qwen 3.8 27B发布:本地部署最强稠密开源模型解析
阿里通义千问Qwen 3.8 27B以开放权重形式发布,被誉为目前最好的本地部署稠密模型。本文解析其技术定位、27B参数量优势、开放权重的战略意义及社区评价。