[控场AI]
· 4 分钟阅读· 2,342 字

DeepSeek Orb开源:把Harness改成悬浮球,一键接管电脑

DeepSeek Orb开源:把Harness改成悬浮球,一键接管电脑

B站UP主魔改DeepSeek官方Harness,打造出具备双轨agent架构的桌面悬浮球AI操作工具。

DeepSeek V4.1凭借原生视觉能力和约300 tokens/秒的生成速度,使AI操控鼠标键盘的可行性大幅提升。在此基础上,一位B站UP主对官方开源的DeepSeek Harness进行魔改,推出名为DeepSeek Orb的桌面agent产品,以悬浮球形态与用户共享屏幕和输入设备。其核心创新在于双轨agent架构:复杂长任务交由后台agent(通常搭配GLM-4.5 Flash等轻量模型)异步执行,前台悬浮球始终保持响应,可继续接收新指令,实现真正的多任务并行。实测中,后台写网页小游戏与前台开播视频同步运行互不干扰。该项目已在GitHub开源,支持Windows和Mac。

从官方Harness到悬浮球:一次面向桌面的魔改

最新的 DeepSeek广告 V4.1 版本带来了两个关键变化:一是原生动态视觉能力,模型终于能够理解和处理屏幕上的实时图像;二是极快的 token 生成速度,某些场景下可以达到约 300 tokens/秒。这两点结合,直接改变了 AI 操作电脑的可行性——当生成速度足够快时,让模型接管鼠标键盘去点击按钮、复制粘贴,反而比人类手动操作更迅速。

基于这个判断,这位 B站 UP主 把官方最新开源的 DeepSeek Harness 做了魔改,做成了一款名为 DeepSeek Orb(悬浮球) 的 agent 产品。视频开头展示的几个案例——让模型用画笔手绘自己的头像、直接把在线测试丢给它去做、甚至让它玩小游戏——都是在 DeepSeek Orb 上跑出来的。

于是我魔改了官方最新的开源DeepSick Harness

DeepSeek Harness 是 DeepSeek 官方开源的 agent 框架,提供了一套标准化的工具调用(tool use)接口,让模型能够通过结构化方式调用外部能力——例如截图、执行代码、操作文件系统等。Harness 的设计思路是把「模型推理」和「工具执行」解耦:模型输出结构化的动作指令,Harness 负责实际执行并将结果反馈给模型,形成一个观察-决策-行动的循环。对开发者而言,Harness 相当于一个可扩展的脚手架,只需在其基础上接入新的工具或改造交互层,就能快速构建具备实际操作能力的 agent 应用。DeepSeek Orb 正是沿用了这套核心循环,在其上叠加了悬浮球 UI 层和双轨调度逻辑。

主窗口 + 悬浮球:两套界面各司其职

DeepSeek Orb 在结构上分为两部分:主窗口和悬浮球窗口。

主窗口本质上就是 DeepSeek Harness 本体,功能与官方版本完全一致,因为它用的就是官方的实现。真正的新东西在悬浮球窗口——它是 Harness 的一个「操作电脑」模式,与用户共看同一个屏幕、共用同一套鼠标键盘。

作者演示了一个典型链路:唤起悬浮球后直接下达自然语言指令,让它去京东搜索指定手机、截取商品信息的屏幕、再通过微信发送给联系人确认。整个过程模型自己完成了搜索、截图、跨应用发送等一系列操作,用户只需用一句话描述需求。

是DeepSick Harness一个操作电脑的模式

双轨 agent 架构:前台不被长任务卡住

DeepSeek Orb 最值得关注的设计,是它的双轨 agent 架构,分为悬浮球 agent 和后台 agent。

这个设计解决了一个实际痛点:如果一个复杂任务需要长时间占用鼠标键盘,用户在此期间就无法做别的事。为此,当悬浮球接收到需要长链路执行的复杂任务时——比如写代码、做 PPT、做产品调研——悬浮球 agent 会把任务转交给一个运行在后台的标准模式 agent 去执行。

这样一来,前台 agent 不会被长任务占用,用户既能看到后台任务进度,还能随时向悬浮球下达新指令。作者提到后台 agent 一般搭配智谱 GLM-4.5 Flash 之类的模型来跑。

比如说写代码

实测:一边写小游戏,一边开电视剧

演示中,作者让后台 agent 制作一个类似「羊了个羊」的简单网页小游戏,任务在主窗口里以后台形式执行。在等待期间,他又通过悬浮球给出新指令,让前台去腾讯视频打开某部电视剧的第一集——两条任务并行不冲突。

后台任务执行完毕后,悬浮球会立即收到后台 agent 的完成通知并打开成果,小游戏可以直接上手玩,功能验证通过。这种「后台干活、前台待命」的协同方式,是双轨架构价值的直接体现。

这个时候还可以在悬浮球上给他其他的人物

智谱 GLM-4.5 Flash 是智谱 AI 推出的轻量级大语言模型,主打低延迟和低成本,适合在 agent 任务中承担「执行层」角色——即在明确任务目标后进行大量重复性推理与工具调用,而不需要复杂的多轮对话或创意生成能力。在双轨架构中,后台 agent 往往面对的是已被分解清楚的子任务序列,对模型的要求更多是稳定、快速、经济,这正是 Flash 系列模型的优势区间。相比之下,悬浮球前台 agent 负责理解用户的模糊自然语言指令并做任务拆解,对语义理解能力要求更高,因此更适合搭配能力更强的旗舰模型。两者分工配合,在效果和成本之间取得平衡。

开源与获取方式

该项目名为 DeepSeek Harness Orb,已经在 GitHub 开源,支持 Windows 和 Mac 两种操作系统。用户可以在 GitHub 上直接下载软件安装包,也可以从视频简介中获取。

从产品思路看,DeepSeek Orb 是一次典型的「模型能力升级驱动交互形态创新」案例:正是 V4.1 的原生视觉与高吞吐速度,使得 GUI 层面的自动化操作从「勉强能用」变成了「快过人手」。而悬浮球加双轨架构的组合,则给出了一个更贴近日常使用习惯的桌面 agent 形态参考。

需要注意的是,让 AI 接管鼠标键盘并跨应用操作(尤其涉及购物、发送消息等)存在一定的权限与安全边界问题,实际使用时对敏感操作仍建议保留人工确认环节。

分享:

相关推荐