给DeepSeek编程智能体装上网页操作能力:Harness桌面版+TinyFish实战

DeepSeek Harness 桌面版以插件架构扩展智能体能力,配合 TinyFish 填补网页操作缺口。
DeepSeek Harness 桌面版本质上是一个「宿主+插件」架构的 agentic coding 框架:应用本身只是外壳,模型路由、网页搜索、agentic 循环等核心能力均以插件形式存在,扩展能力只需新增文件而非改动代码。其 UI 独特地展示了完整执行轨迹与缓存命中率,使推理过程透明可观察。原生 web 工具仅支持只读抓取,无法完成登录、点击等交互;通过接入 TinyFish 的 MCP 服务,可为 agent 补上完整的网页操作能力,包括登录、填表、定时监控与免密会话复用。整套扩展同样适用于 Claude Code、Codex、Cursor 等主流 agentic 系统,体现了以插件为中心的开源 harness 架构将能力边界交还给使用者的核心价值。
DeepSeek Harness 桌面版:插件才是真正的主角
DeepSeek广告 近期发布了其编程智能体框架 DeepSeek Harness 的桌面版本。作为开源领域增长最快的 agentic coding harness 之一,它以极简设计配合强大能力著称,其插件系统和 prompt caching(提示词缓存)机制被不少开发者视为当前最优实现之一。
桌面版并没有推翻原有架构。它本质上是围绕完整 Harness Web 应用的一层原生外壳:打开应用时,后台会启动一个本地 Harness 进程,自动选择端口并在窗口中加载界面。真正值得玩味的是它的组织方式——一个贴切的心智模型是:应用只是宿主,插件才是产品。
模型路由、网页搜索、终端、乃至整个 agentic 循环,本质上都是以插件包的形式存在。每个 profile 对应一个 patch 文件,你可以在其中开启、关闭或配置插件,应用层之上还提供了插件管理器。这种设计的直接意义在于:为智能体添加新能力不再是改代码,而只是往插件系统里加一个文件。

Agentic coding harness 是一类以大语言模型为核心、能够自主规划并执行多步骤编程任务的框架。与简单的代码补全工具不同,它会在一个「推理—行动—观察」的循环中反复调用工具(文件读写、终端命令、网页搜索等),直至完成目标。"Harness" 一词在此语境下源自测试工程术语,强调它是一套将模型能力"套入"具体任务流程的脚手架。近年来涌现的同类框架包括 Aider、Continue、OpenHands 等,DeepSeek Harness 的差异化定位在于其以插件为核心的可扩展架构以及对提示词缓存的深度利用。
Prompt caching(提示词缓存) 是指在连续的对话轮次或 agent 循环中,将重复出现的上下文前缀(如系统提示、已加载的代码文件)在推理服务端缓存,后续请求命中缓存的 token 无需重新计算,从而大幅降低延迟与费用。DeepSeek、Anthropic Claude 等主流模型 API 均已支持该机制,但多数 harness 并不对用户暴露缓存命中情况;DeepSeek Harness 将其作为一等指标展示,是其区别于同类工具的实用特性之一。
独特的 UI:让智能体的内部运作可见
Harness 的聊天界面与常见工具类似,但它在每一轮 agent turn 中都会完整展示 trajectory(执行轨迹):你提供的上下文、用户消息、助手采取的每一步、具体的工具调用、每一步消耗的 token 数量以及耗时。这种可见性让使用者能直接观察智能体的内部运作逻辑。
更难得的是,它会显示 cache hit rate(缓存命中率)——这是其他 harness 几乎都不展示的指标。DeepSeek Harness 在缓存命中率上的表现相当出色,意味着它能有效保留缓存,从而显著降低推理成本。
它内置四种模式:
- Standard 模式:处理代码、文件和信息的通用模式
- PTC 模式:涵盖标准模式全部能力,更适合需要批量工具调用、过滤、整理和去重的任务
- Minimal 模式:类似 Pi,仅保留少量终端工具,可在其上自行扩展
- Creator 模式:允许针对特定需求深度定制整个 agentic 体验,思路接近 Claude Code 的 mods 功能
原生网页能力的边界:只能读,不能动
开箱即用的 DeepSeek Harness 自带两个网页工具。第一个是 web search,在模型轮次内运行 DeepSeek 自家的搜索;第二个是 web fetch,下载公开页面并把文本交给模型,可以抓取任意指向的网页。
但这两者都是只读工具。fetch 虽然可以自主发起请求,却不会携带 cookie 或凭证,也不会像浏览器那样真正渲染页面。这意味着它擅长获取信息,却无法完成需要登录、点击按钮的操作任务。
官方虽有实验性的 browser use 和 computer use 插件,但尚未默认安装,且需要自行接入本地浏览器。而现实中,大量真正有用的内容都藏在登录和 dashboard 背后——一个只能搜索的智能体是远远不够的。
TinyFish:给智能体装上操作网页的「双手」
解决这个缺口的方案是 TinyFish。本视频与其合作,演示如何为 Harness 扩展能力。TinyFish 的定位是智能体的 Web 基础设施——介于你的 agent 与实时网页之间的一层:agent 决定需要什么,把网页部分交给 TinyFish,拿回干净的结构化结果,不必处理杂乱的 HTML。

TinyFish 通过一个 API 提供四种产品:
- Web Search:返回实时网页结果
- Fetch:用真实浏览器渲染 URL,返回干净文本(Search 和 Fetch 在所有套餐、任意用量下均免费)
- Web Agent:用英文下达目标,它会自动导航、点击、填表、处理登录,返回结构化 JSON,运行在 TinyFish 自家的 Mako 模型上,按步骤计费
- Browser:提供可用 Playwright 驱动的云端浏览器,内建反爬保护和凭证保险库,让 agent 无需暴露密码即可登录
注册无需信用卡即可获得试用额度。Search 和 Fetch 免费,钱包额度仅用于 Agent 和 Browser。
MCP(Model Context Protocol) 是由 Anthropic 提出、目前正在成为 agentic 生态事实标准的开放协议,定义了「主机(host)」与「工具服务器(MCP server)」之间如何交换工具描述、调用请求与返回结果。任何实现了 MCP server 接口的服务都可以被支持 MCP client 的 harness 直接调用,无需为每个 harness 单独编写集成代码。TinyFish 将其网页能力封装为 MCP server,DeepSeek Harness 通过其 MCP client 插件接入,这正是整套扩展方案「只加一个插件文件」即可生效的技术基础。Playwright 是微软开源的浏览器自动化框架,支持对 Chromium、Firefox 和 WebKit 进行脚本化控制,是「Browser」产品背后驱动真实浏览器完成点击、填表等操作的底层工具。
配置过程:加一个插件文件就够了
TinyFish 运行一个 MCP 服务器,而 DeepSeek Harness 恰好有 MCP 客户端插件。在桌面 profile 的 patch 文件中,加入 MCP client 插件、设置服务器名称、指向 TinyFish 端点、将 API key 作为 header 传入即可。
API key 不必写死在文件里,可以从环境变量读取——这样配置文件能安全共享而不泄露任何凭证。重启应用、开启新会话后,TinyFish 的工具就会与其他工具一同出现。

同样的方式也适用于 Claude Code、Codex、Cursor 等其他 agentic coding 系统,官方提供了简单的安装说明。
实战演示:从搜索到登录再到复杂筛选
搜索与抓取:让 agent 搜索 DeepSeek Harness 桌面版发布信息并原样返回,得到包含标题、链接、摘要的结构化实时结果;让它通过 TinyFish 抓取 Hacker News 首页并返回头条,几乎瞬间完成,文本干净无杂乱菜单,且非常 token 高效。
登录操作:这是原生工具无法完成的部分。在一个发布自身演示账号密码的公开测试站点上,agent 完成了打开页面、输入用户名密码、点击登录、读取信息、再登出的完整流程,并以 JSON 返回结果。右侧还能实时观看 agent 的浏览器操作过程。
复杂筛选:一个更有挑战的任务——到 Hugging Face 筛选文本生成模型、按 trending 排序、给出参数量不超过 300 亿的前五名。prompt 要求非常明确:逐条阅读每个模型标注的参数量,跳过超过 30B 的。这份列表埋了陷阱:一个模型名带「29B」但 Hugging Face 标注为 310 亿(应跳过,agent 确实跳过了),另一个名为「27B」实则 70 亿参数(应保留,agent 也正确识别)。

这里的经验是:prompt 和规则越明确,结果越可靠,并强烈建议用 Hugging Face 官方 API 核对结果。
监控与免密登录:让智能体持续工作
还有两个值得关注的能力。Monitors(监控):让 TinyFish 每六小时查看一次 Harness 发布页,建立基线后仅在版本有实质变化时才通知——于是你得到一个会持续替你盯着网页的智能体,而非一次性运行。
Saved Login(保存登录):与其把密码交给 agent,不如自己在 TinyFish 浏览器会话中登录一次并保存为 profile,之后 agent 直接复用该会话,既不再询问密码,也永远看不到你的密码。
成本方面,Search 和 Fetch 免费,登录任务和 Hugging Face 筛选任务各自的 agent 步骤成本都远低于一美元。由于这类任务往往需要几分钟完成,建议放到后台运行,桌面应用会将其显示为后台进程。需要注意的是,若 agent 频繁轮询检查任务是否完成,等待本身也会产生 token 成本,可指定合理的检查间隔。
在 agentic 工作流中,token 成本的隐性消耗往往来自等待循环而非实际任务执行。当 agent 需要等待一个需数分钟才能完成的后台任务时,若以「每隔几秒轮询一次」的方式检查状态,每次轮询都会触发一轮完整的上下文传递与模型推理,累积的 token 消耗可能远超任务本身。合理的做法是在 prompt 中明确指定检查间隔(如每 30 秒或 1 分钟),或利用支持异步回调的工具设计让 agent 在结果就绪时才被唤醒,从而在成本与响应速度之间取得平衡。
扩展性才是开源 Harness 的真正价值
整个演示的核心逻辑是:通过外部插件,你为一个本就强大的 agentic coding harness 补上了「操作网页」这一开源 harness 和开源模型普遍缺失的能力。更重要的是,这种扩展几乎不涉及代码改动,并且可以接入任意你选择的模型。
这种以插件为中心的架构,正是 DeepSeek Harness 强大之处的根源——它把智能体的能力边界从框架作者手中交还给了使用者。
相关推荐

OpenSwarm:让智能体接管整台机器的AI优先操作系统
OpenSwarm是一款AI优先的操作系统,让智能体群接管整台机器——应用自生成、浏览器自驱动、多智能体协同作业。本文解析其核心理念、三大能力与现实挑战。

Claude Haiku 5.5发布:Anthropic最快的小模型详解
Anthropic发布Claude Haiku 5.5,定位最快最强的小模型,专为摘要、分类、编码子代理、客户支持等高频低成本任务打造。本文解析其应用场景与对开发者的价值。

OpenSEO:开源版Semrush,为AI Agent提供SEO数据能力
OpenSEO是一款开源的Semrush替代品,通过MCP协议为AI Agent提供SEO数据、工具与集成能力,并新增AI Visibility功能支持生成式引擎优化(GEO)。在Product Hunt登上榜单第3位。