DeepSeek Harness实测:安装配置+ComfyUI插件驱动AI创作全流程

前言:国产Agent终于能打了
在AI编程与Agent工具长期被Claude Code、Codex等海外产品主导的当下,DeepSeek Harness的出现让国内开发者眼前一亮。B站UP主欧阳经过一周的深度体验后给出了三字评价:"行到爆"。简单来说,它已经具备了成为国内"国民级"AI Agent工具的潜质。
AI Agent(智能体)是指能够自主感知环境、制定计划并执行任务的AI系统,区别于传统的单轮问答模型。在编程领域,Agent工具能够理解代码库上下文、调用终端命令、读写文件并进行多步推理。Claude Code由Anthropic推出,Codex由OpenAI推出,二者均基于各自的大语言模型构建,具备代码生成、调试和重构能力。这类工具的核心技术架构包括工具调用(Tool Use/Function Calling)、上下文窗口管理以及ReAct(Reasoning + Acting)推理框架,使模型能够在思考与行动之间交替迭代,最终完成复杂任务。
本文将基于其实测经验,系统梳理DeepSeek Harness的入门配置方法,并重点解析一个能够驱动ComfyUI工作流的自研插件——这或许代表了国产AI工具链走向成熟的一个缩影。
DeepSeek Harness入门:从安装到模型配置
三种安装方式,桌面版最亲民
DeepSeek Harness官方提供了两种主流安装方式:一是通过NPX命令(需预装Node.js),二是通过Git源码本地编译启动。这两种方式对新手并不友好。
NPX是Node.js生态中的包执行器(Package Runner),随npm 5.2+版本自动安装,它允许开发者无需全局安装即可直接运行npm包中的命令行工具。Node.js则是基于Chrome V8引擎的JavaScript运行时环境,使JavaScript能够在服务器端运行。许多现代AI工具选择Node.js作为运行时,是因为其事件驱动的非阻塞I/O模型非常适合处理大量并发的API请求和流式输出。通过Git源码编译则需要开发者具备版本控制工具Git的使用经验,以及对依赖管理和构建流程的基本理解。
更推荐的做法是使用社区提供的桌面版(DSH Desktop)。这个开源方案有官方上游团队成员参与,可以视为变相的官方桌面客户端。它已兼容Windows和Mac系统,目前最新版本为2.02,下载安装文件后一键运行即可,无需任何命令行操作。

API Key配置与第三方模型接入
首次运行需要在DeepSeek开放平台创建API Key并填入。API Key是一种身份认证令牌,用于标识调用者身份并进行用量计费。开发者在DeepSeek开放平台注册后,系统会生成唯一的密钥字符串,每次API请求都需携带该密钥。启动后的界面极其简洁,UP主形象地将其类比为"DeepSeek版的Codex"——旁边只有一个聊天栏,但实际功能要比Codex更丰富,同样支持插件生态。
在模型配置上,除了直连DeepSeek官方,还可以接入第三方中转API。第三方中转API(如文中提到的端脑云)本质上是API网关代理服务,它们批量采购模型供应商的调用额度,再以更低的单价分销给终端用户,这种模式类似于云计算中的RI(预留实例)转售。UP主实测使用的是端脑云(CEP)的端点,通过"添加自定义提供方"填入Base URL和Key,即可检索并勾选所需模型(如Flash、智谱GLM等)。其Base URL是中转服务的API端点地址,替换官方的默认地址后,请求会先经过中转服务器再转发至模型提供方,从而实现价格优惠和多模型聚合。第三方渠道的优势在于价格通常比官方更低,且模型选择更丰富。
三种工作模式的差异
Harness提供了三种运行模式,理解它们的区别对高效使用至关重要:
- 标准模式:具备全部Harness功能,包括命令行、Agent调度、子Agent、Skills加载等,是日常办公的首选。
- PTC模式:支持工具的连续链式调用,适合批量脚本操作,在已有完整Skills办公流程时效率更高。
- 创造模式:可查看并修改所有插件,用于构建自己的插件、改写Harness框架。
Harness插件生态:真正的杀手锏
插件市场安装方法
桌面版初始并未内置插件市场,需要手动安装。方法是访问社区的awesome-DSH-plugin项目,复制其安装命令行,在Harness的工作区对话中发送即可自动完成安装。安装后重启应用,设置页面就会出现"插件市场"选项。
值得一提的是使用体验:由于底层跑的是DeepSeek Flash模型,每秒token输出可达100多,效率远超需要解决网络问题的Codex或Claude Code。Token是大语言模型处理文本的基本计量单位,中文场景下约1.5-2个汉字对应一个Token。UP主强调"一行一行很舒服,它会告诉你在做什么",且缓存命中率高达91%,大幅降低了实际成本。所谓缓存命中率指的是KV Cache(键值缓存)的复用率——当连续对话中前缀内容与上一轮相同时,模型可以直接复用已计算的注意力矩阵,无需重新计算。DeepSeek的缓存命中Token价格仅为未命中价格的十分之一,因此高缓存命中率意味着实际费用大幅下降,这也解释了为什么Agent工具的多轮对话场景特别适合DeepSeek的计费模型。

丰富的UI增强插件推荐
插件市场内容极为丰富且每日更新,涵盖UI增强、用量统计、主题外观等多个维度。UP主推荐安装类似Codex右侧扩展窗口的插件,可以直观查看文件夹内容、预览文件结构和代码。此外还有集成任务看板、桌宠、终端、浏览器等功能的WebUI插件供选择。
安装过程中若遇到脚本被拦截,只需点击"放行脚本"即可继续。安装完成后,界面会新增检测更新、文件夹面板、终端等按钮,整体布局趋近于VS Code的开发体验。这也印证了插件的本质:每个插件都是Harness产品的一部分,通过不同插件的组合,用户可以打造属于自己的差异化工具界面。
核心亮点:ComfyUI驱动插件深度解析
让Agent接管AIGC工作流
本次分享的重头戏,是UP主花两天时间开发的开源ComfyUI插件。其核心价值在于:让DeepSeek Harness的Agent能够识别、管理并驱动ComfyUI的完整工作流,实现AI创作的自动化编排。
ComfyUI是一款基于节点(Node)的开源图形化AI图像/视频生成工具,采用有向无环图(DAG)的工作流架构。用户通过拖拽和连接不同功能节点(如模型加载、提示词编码、采样器、VAE解码等)来构建完整的生成流水线。相比Stable Diffusion WebUI的表单式界面,ComfyUI的节点化设计提供了极高的灵活性,用户可以精确控制生成过程中的每一个环节。其底层支持Stable Diffusion、SDXL、Flux、HunyuanVideo等多种模型架构,已成为AIGC社区中最受欢迎的创作工具之一。
该插件通过Web版接入(需从桌面版切换),配置本机或服务器的ComfyUI地址(默认8188端口)、Key以及网络回环地址。若使用桌面版ComfyUI,还需设置listen启动参数以确保内网可被监听到。
从图工作流到API工作流的自动转换
插件面板包含三个核心流程。第一步是工作流的识别与提取:ComfyUI的图工作流(graph workflow)无法直接用于API请求,必须转换为API工作流。传统做法需要手动"导出API",而该插件能自动识别图工作流并提取转换。
从技术层面看,图工作流是面向人类用户的可视化表示,包含节点的位置坐标、分组信息、UI布局等元数据,以JSON格式存储。而API工作流则是面向程序调用的精简格式,剥离了所有视觉层信息,只保留节点类型、输入参数和连接关系,可以直接通过HTTP POST请求发送给ComfyUI的/prompt端点执行。两者的数据结构差异显著:图工作流中节点以数组形式存储且包含坐标属性,API工作流则以节点ID为键的字典结构组织,每个节点仅包含class_type和inputs字段。这种转换是实现程序化调用ComfyUI的必要步骤。

这里有个关键经验:最适合转换的是单一执行流程,即只有一个从加载模型到图像/视频保存的完整链路。对于多流程组合的复杂工作流,插件支持"分量剔取",可选择整体剔取、分流剔取或提取节点数最多的主流程。
参数化控制:Agent自主调参的精髓
转换为API工作流后,插件会自动提取采样步数、随机种子、时长、分辨率等基础参数,并要求用户为工作流填写描述和标签(如"文生视频""图生视频"),让大模型能够判断该调用哪个流程。

UP主对这一设计的理解颇具洞见:"这就是Coze、n8n唯一缺少的——对工作流参数的变通性。"传统方案下让模型每次输出完整工作流会消耗大量Token,而该插件只需复制模板并覆盖提取出的参数即可。你想让Agent控制哪些参数,就提取哪些参数,既灵活又节省成本。
破解DeepSeek无视觉能力的巧思
DeepSeek目前不具备视觉模型,无法接收和理解图像。针对这一痛点,插件设计了"加载区"方案:可读取仓库中的图像、视频、音频资产,Agent通过文件名将图片传给图生流程。UP主坦言这是"比较不智能"的临时方案,未来计划接入独立的视觉模型进行图像反推翻译,以获得更精准的效果。
同步与异步:智能调度的执行机制
插件的Skills中定义了两种执行方式:同步会阻塞对话直到生成完成,异步则不阻塞,任务提交后Agent可继续处理其他请求,生成完毕后主动通知用户。
从技术角度看,同步(Synchronous)执行采用阻塞式调用模式:Agent发出生成请求后会持续等待ComfyUI返回结果,期间无法处理其他任务,这类似于打电话时必须等对方说完才能继续。异步(Asynchronous)执行则采用非阻塞模式:Agent提交任务后立即释放控制权,通过WebSocket长连接或轮询机制监听任务状态,任务完成时触发回调通知。在AIGC场景中,一个视频生成任务可能耗时数分钟甚至数十分钟,异步模式使Agent能够同时管理多个并行任务,极大提升了工作效率。这与操作系统中的进程调度和Web开发中的异步I/O是同一设计思想。
这一机制为后续的智能编排奠定了基础——Agent可以并行调度多个视频生成任务,24小时不间断产出内容。
生成结果会通过"回显"功能直接在对话窗口中展示,支持图像预览和视频播放。需注意回显发生在工具调用阶段,而非最终生成后。
Skills机制与使用费用分析
三层Skills兼容体系
Harness的Skills机制兼容Agent、Codex的规范,分为三个层级:项目级(项目根目录的.agent/.skill)、用户级(C盘用户根目录的全局Skills)以及插件内置的skills.js。
Skills机制本质上是一种分层的系统提示词(System Prompt)注入方案,灵感来源于Anthropic Claude的CLAUDE.md和OpenAI Codex的AGENTS.md规范。它允许开发者将特定领域的指令、约束和操作规范以文件形式持久化存储,Agent在启动时自动加载这些规则到上下文窗口中。三层优先级设计(插件内置→用户级→项目级)遵循了软件工程中经典的配置覆盖模式:越靠近具体项目的配置优先级越高。这种机制使得Agent的行为可以被精确定制,而无需每次对话都重复说明规则。
插件的工作流程逻辑正是写成内置Skills与插件绑定,实现了功能的模块化封装。
费用成本:便宜但仍有优化空间
UP主坦诚地分享了费用数据:开发这个插件的对话跑了100多轮、2000多步,消耗了500-600M的Token,成本约300元左右,超过了Claude Code一个月170元的订阅费用。
最大的遗憾在于DeepSeek没有推出订阅套餐,只能按API用量计费。工作时段使用费用较高,若在凌晨或深夜使用可以便宜约三分之一。UP主呼吁DeepSeek推出订阅制,让用户使用更加自如。
结语:国产AI工具链的成熟信号
经过一周的深度使用,UP主的核心判断是:国内模型与应用产品正在快速追赶海外水平。DeepSeek Harness凭借高速的token输出、丰富的插件生态和亲民的桌面版,配合可自研的ComfyUI驱动插件,已经能够胜任从代码开发到AIGC内容自动化生成的复杂场景。
虽然在视觉能力、订阅计费等方面仍有提升空间,但这套国产Agent工具链所展现出的开放性、可扩展性和实用性,无疑是一个值得期待的信号。对于希望搭建自主可控AI创作流水线的开发者而言,DeepSeek Harness值得一试。
相关推荐

RealSense SDK v2.58.4发布:GPU零拷贝与AI感知框架全面升级
RealSense SDK v2.58.4正式发布,引入Jetson平台GPU零拷贝帧访问、统一Perception AI感知框架、逐检测距离报告、GMSL多相机部署支持及ROS2 H.264流传输等重要更新,大幅提升边缘AI深度感知性能。

OmniRoute拆解:5.7万Star的AI统一网关如何管理多服务商路由
深度拆解OmniRoute这款5.7万Star的开源AI网关,解析其三层故障隔离、自动路由评分、上下文压缩等核心机制,帮助开发者用一个入口统一管理多个AI服务商和编程工具。

ChatGPT成为深夜倾诉对象:AI情感陪伴为何击中无数人
一位新手父亲凌晨4点向ChatGPT倾诉育儿焦虑,十年未哭的他失声痛哭。越来越多人把AI当作深夜情感支持,这背后是24小时无门槛的可及性、零评判的安全感,也折射出现代社会人际连接的匮乏。探讨AI情感陪伴的价值与边界。