给Agent装上屏幕:DeepSeek可视化工作台开源实录

当Agent长出手脚,却还在靠聊天控制
今年是Agent爆发的一年,AI已经能替我们真正干活。但一个尴尬的现实是:我们与Agent交互的主要方式,仍然停留在自然语言对话上。
一位B站UP主用一个很形象的比喻概括了这个矛盾——「这就好像我们从非智能手机换成了智能手机,却仍然只用Siri语音来控制它」。在批量重复或复杂任务中,语音(对话)确实高效;但如果连一些简单操作都要靠打字描述给AI,那种体验的别扭感相信不少人深有体会。
基于这个思考,他花了大约一周时间「爆改」了一个基于 DeepSeek Harness 的可视化工作台插件,并已完全开源。DeepSeek Harness 是基于 DeepSeek 大语言模型构建的开发框架,采用插座协议(Plugin Protocol)设计,允许开发者在不修改核心代码的前提下注入自定义功能模块——类似于 VS Code 的扩展系统或 Chrome 的插件生态,宿主程序提供标准化接口,插件通过约定的协议与宿主通信。用他自己的话说,这个工作台就是要「给智能手机装上一块可以操纵的屏幕」——你依然可以用右侧的对话框(Siri)去指挥,但一些日常操作可以直接在可视化面板上完成。
工作台能做什么:六个真实项目案例
这个可视化工作台最有说服力的地方,在于它不是概念演示,而是跑起来的一批实际项目。UP主在视频中逐一展示了自己搭建的六个应用,覆盖了完全不同的行业与需求。
旅行足迹地图
这是最完整的一个项目。左侧是去过的国家列表,可增删拖动;右侧是详情面板与相册。点击相册能浏览原图,甚至支持无人机360度全景图预览。
值得一提的几个细节:照片的经纬度和高度坐标信息被准确抓取并用于地图定位;地球的光影关系与现实时间同步(现实是夜晚,对应区域也呈现黑夜状态);瓦片地图可以无级缩放且保持清晰。所谓瓦片地图(Tile Map),是现代Web地图的核心技术,其原理是将世界地图在不同缩放级别上预先切割成统一大小的图片方块(即「瓦片」),用户浏览时前端只加载当前视口范围内所需的瓦片。随着缩放或拖动,新的瓦片被按需加载,这种「金字塔」式的多级别切片策略使得地图可以在任意缩放级别保持清晰,同时大幅降低网络传输量。这种「存档点」式的记录方式,让旅行回忆多了一层可交互的意义。

建筑审图软件
这是最能体现「行业深度」的项目。UP主本身从事建筑行业,深知AI在这一垂直领域的尴尬:前沿公司不会把建筑作为后训练重点,导致AI只能介入前期想法或后期效果展示。
他的做法是:向工作台注入国家规范与地方规范,在 Skill 层面做「强化学习」式的优化(并非真的改模型)。软件读取 DXF 文件,通过坐标识别每一根线,再结合天正默认的图层命名规则理解线的意图与空间位置。DXF(Drawing Exchange Format)是Autodesk公司开发的一种开放的CAD数据交换格式,几乎所有建筑设计软件都支持。在中国建筑行业,AutoCAD配合天正建筑插件是最主流的施工图绘制工具链,天正有一套约定俗成的图层命名规则——例如「WALL」表示墙体、「WINDOW」表示窗户等,这使得程序可以通过图层名称推断每根线条的语义含义。传统审图流程依赖持证审图员逐条对照国家规范(如《建筑设计防火规范》GB50016)进行人工核查,耗时且容易遗漏,而AI审图的核心挑战在于不仅要识别几何形状,还要理解建筑语义。
审查时先给项目定位、筛选适用规范,再逐条过滤。演示中,它成功识别出了消防车道、住宅轮廓、消防登高面、回车场、建筑防火间距等要素,并对确定项标记通过、对不确定项打问号。规范条文可以拖入窗口进行逐条对照验证。

AI学习网站
为了搞懂 Transformer 架构、Embedding 向量、卷积核这些抽象概念,UP主让AI抓取了 GitHub 上高 Star 的教程(如 LearnCode、Awesome Agentic AI、Karpathy 的神经网络教程),按章节归类、按学习顺序排序,形成了一张知识网络地图。
这里涉及的几个核心概念值得展开:Transformer 是2017年Google在论文《Attention Is All You Need》中提出的神经网络架构,用自注意力机制取代了传统的循环结构,成为当今几乎所有大语言模型的基础架构。Embedding(嵌入向量)是将离散符号映射到连续向量空间的技术,语义相近的词在向量空间中距离更近,这也是语义搜索和RAG(检索增强生成)的数学基础。卷积核(Convolutional Kernel)则主要用于计算机视觉领域,是一个通过在图像上滑动并执行元素乘法来提取局部特征的小型矩阵。Karpathy 的教程是指前OpenAI研究员 Andrej Karpathy 制作的系列课程,因从零构建神经网络的教学方式而广受好评。
更关键的是配套的互动工具——比如卷积核的实图机制动画、Token 分词器、Embedding 语义地图等。他的观点很有启发性:在Agent时代,视听维度更高的信息更容易被人接受,图片优于文字,视频又优于图片。
自媒体视频动画工作台
这是一个文案到动画的生成流程:左侧输入文案,AI进行语义切分;第二步在切分内容上添加特效;第三步像PPT一样编辑画面、添加文字框,实时预览。底部还有一条按时长定义宽度的整体快照时间轴,能显著节省做解释视频的时间。
助理机器人
这是一个信息筛选与推广工具。上半部分通过 Twitter/X CLI 抓取信息,可设置抓取数量与保留数量,AI会做关联性打分。相比传统搜索,噪音更小、自由度更高、没有广告。抓取本身是毫秒级,但为减少对平台压力,加入了几秒的搜索抖动。
下半部分是自我推广小程序:先礼貌回复对方消息,再克制地推广自己的内容,生成的回复列表可逐条批准、拒绝或复制手动发送。

健身训练地图
最简单的一个:点击身体某部位(如肩、上胸)即可查看训练方法与动作,并支持记录训练数据。功能简单,但体现了「任何想法都能快速落地」的理念。
从想法到落地:完整项目创建流程
为了展示完整流程,UP主现场创建了一个「艾尔登法环互动地图」项目。
步骤大致是:点击添加项目 → 选择布局(不满意可自定义,AI会注入提示词生成布局)→ 命名并选择项目文件夹 → 进入工作区。每个项目必须绑定一个对话,左侧工作台的小圆点既是对话入口,也是状态指示器——工作中会变成动态图标,完成后变为绿点。
他刻意用了「最简单的一句话」提示词来测试恶劣工作环境下的表现。最终DeepSeek自己生成了瓦片地图,可缩放、可标记、可搜索定位。不过他也坦率吐槽:「永远不要让DeepSeek自己去画内容,它画的东西很丑,它是一个纯理科生」,建议让它去网上找现成素材,并通过多轮沟通逐步修改。
这次一周的高强度使用消耗了接近30M token。Token是大语言模型处理文本的基本单位,中文大约2-3个字符对应一个Token。30M(3000万)Token的消耗量相当于阅读或生成了约100本普通中文书籍的文本量。在Agent场景中,由于需要多轮对话、工具调用和上下文维护,Token消耗量会远超单次问答——一次复杂的审图任务可能就需要消耗数十万Token。DeepSeek此前以极低的API价格吸引了大量开发者,但近期的价格调整让高频使用者明显感受到了成本压力。他也直言在涨价之后成本「确实变肉疼了」。

Agent时代的交互革命:三点核心思考
UP主在最后给出的三点思考,比工具本身更值得玩味。
一、交互方式的升维
他认为AI大模型没变,「智能手机」还是那个智能手机,但交互方式变了。工作台就像给手机装上可操作的屏幕,右侧对话框是Siri,简单操作走屏幕,复杂任务交给对话。这是一次从「纯语音控制」到「图形+语音」的交互升维。
这一思考背后有着深厚的人机交互(HCI)理论支撑。从命令行到图形界面(GUI),从鼠标键盘到触摸屏,每一次交互范式的变革都带来了计算设备用户规模的数量级增长。当前Agent的纯对话交互,本质上是一种退回到「命令行时代」的体验——用户需要用精确的语言描述意图,这对表达能力和耐心都提出了很高要求。可视化工作台的价值在于将「直接操作」(Direct Manipulation)这一GUI的核心原则重新引入Agent交互,让用户可以看到、点击、拖拽,而不仅仅是描述。
二、满足「因为你是你」的独特需求
他强调,这个世界上一定存在只有你才想得到的需求。自媒体人可以用它管理稿件、在文字与视频媒体间转换;游戏玩家可以搭建辅助网页。工作台提供了一个「像乐高一样的底座」,以散装形式进入每个人的工作环境,让每个人都能拥有一块属于自己赛道的屏幕。
三、深入行业的「神经末梢」
这是最深刻的一点。UP主指出:厂商做的Agent一定是一个「中位数取值」,开发者能搭建通用基础设施,却很难进入各行各业去理解真实意图。这一洞察触及了AI产品化的核心矛盾——大厂在训练和部署Agent时必须面向最大公约数用户群体优化,通用能力强但垂直深度不足。这与经济学中的「长尾理论」形成呼应:头部通用需求被大厂覆盖,但数量庞大的尾部细分需求却无人问津。
而「一切皆插件」的开源机制,让Agent能走到那些尚未被AI彻底渗透的行业——比如他自己做的建筑审图。这种架构本质上是一种分布式创新机制,将AI能力的「最后一公里」交给最了解业务的从业者自己完成,让行业知识的编码工作从中心化的模型训练转移到去中心化的插件开发。
「每个行业的需求,只有从业者才知道。这是你所在的位置才能做成的产品。」
零入侵设计:一个负责任的技术原则
最后一个细节体现了成熟的工程思维:保证对宿主的干净,不改动、不替换。
他解释道,当前 Harness 还是 0.1 版本(视频中当天刚更新视觉模型预览版),后续必然频繁改动。因此他的插件完全通过插座协议实现,是一个「零入侵的原生增量插件」,即便官方频繁更新,自己的项目也不会因此丢失。这种「零入侵」原则在软件工程中有着广泛的实践——从Linux内核模块到浏览器扩展,成熟的插件系统都强调与宿主的松耦合。特别是在宿主处于早期版本快速迭代阶段时,紧耦合的修改会在每次更新时引发大量兼容性问题,而通过标准化接口通信的插件则可以最大限度地隔离变化。
后续他还计划真正编写面板的 JSON 配置,把界面做得更像真正的仪表盘。对于想拥有专属AI工作台的开发者和从业者来说,这个已开源的项目无疑提供了一个值得研究的起点。
相关推荐

Maiao:在GitHub上实现Gerrit式代码审查工作流
Maiao是一款开源工具,将Gerrit风格的单提交单审查、堆叠式变更等代码审查工作流带入GitHub、GitLab、Gitea等主流平台,无需部署额外服务器即可享受精细化代码审查体验。

微调4B小模型:浏览器任务准确率从22%飙升至63%
通过在3000条浏览器操作轨迹上微调Qwen3.5-4B模型,准确率从22%提升至63%,甚至超越DeepSeek V4 Pro等大模型。详解实验设计、基准测试结果及对开发者的实践启示。

手写微型CNN比推理引擎快3倍:树莓派端侧优化实战解析
一位开发者在树莓派上手写微型CNN,通过SIMD向量化和算子融合三步优化,实现比ONNX Runtime、ncnn等主流推理引擎快3倍的性能。深入解析为何专用代码能在边缘计算场景击败通用框架。