开源桌面端CC-HAHA上手:让AI自动操作你的电脑

开源客户端CC-HAHA新增computer use功能,三步配置即可让AI像真人一样操控图形界面。
CC-HAHA是一款开源免费的桌面客户端,近期新增了computer use(电脑操控)能力,允许AI通过虚拟鼠标直接点击操作图形界面,而无需依赖CLI或API接口。配置仅需三步:下载安装、填写模型API Key、完成系统授权(Mac需授权辅助功能与屏幕录制,Windows免授权)。演示中AI可后台自动运行,不占用用户真实鼠标键盘。不同模型在此任务上表现差异显著——GPT6等顶级闭源模型优于DeepSeek Flash,折射出当前国内外模型在视觉界面操控能力上的差距。OpenAI与Anthropic均已采购大批真机Mac专门训练该能力,虚拟机训练因迁移失灵问题而被放弃,显示出这一能力对真实硬件环境的高度依赖。
开源桌面客户端 CC-HAHA 近期新增了 computer use(电脑操控)能力,让 AI 不再局限于调用 CLI 或 API,而是能像真人一样通过虚拟鼠标点击屏幕、打开浏览器、完成一系列图形界面操作。据 B 站 UP 主阿江的演示,仅靠一个模型配置,就能让 AI 在浏览器里自动搭建出一座「海边小镇」。本文梳理其完整配置流程,并分析 computer use 这类技术当下的价值与局限。
什么是 computer use,为什么重要
computer use 指的是让 AI 直接操作电脑图形界面的能力——不通过命令行,也不依赖软件开放的接口,而是「看着屏幕点鼠标」。这一点补齐了传统 AI Agent 的一大短板:现实中大量应用既没有开放 CLI,也没有提供 skills 或 API,AI 想要操作它们,唯一的路径就是识别界面并模拟人手点击。

国外两大模型厂商都在这个方向上投入了重金。据视频引用的报道,OpenAI 采购了数万台 Mac mini 和 Mac Studio,专门用于强化学习,让 AI 在真机上反复练习操作电脑;同期 Anthropic 也通过 AWS 租用了大量 Mac。值得关注的一个细节是,他们宁可用真机也不用虚拟机——原因在于虚拟机环境里训练出来的操作,迁移到真机时容易「失灵」。这也侧面说明,操作电脑能力的训练远比想象中依赖真实硬件环境。
从技术实现角度看,computer use 依赖多模态视觉模型对屏幕截图进行实时解析,将像素内容转化为语义理解(识别按钮、输入框、菜单位置),再通过操作系统的辅助功能接口(如 macOS 的 Accessibility API)或底层鼠标键盘模拟库来执行动作。整个流程本质上是一个「感知—规划—执行」的循环:截图→识别界面元素→确定操作目标→移动光标并点击→再次截图验证结果。这与传统 RPA(机器人流程自动化)工具的核心差异在于,RPA 依赖预先录制的坐标脚本,换一台分辨率不同的机器就可能失效;而基于视觉语言模型的 computer use 理论上能理解界面语义,具备更强的泛化能力。不过这也正是对模型视觉定位精度要求极高的原因——坐标偏差几个像素就可能点到错误元素,导致整条任务链断裂。
三步配置 CC-HAHA
整个项目完全开源免费,Mac 和 Windows 均可安装,无需 Claude 账号,只要配置一个模型即可使用。
第一步:下载安装。 打开 CC-HAHA 的 GitHub 主页,在页面右侧找到 release 页面,往下滑动即可找到对应操作系统的版本下载。
第二步:配置 API Key。 打开应用后进入左下角设置,找到「服务商」选项。你可以选择从 cc-switch 导出已有配置,也可以直接点击「添加服务商」。演示中选用了 DeepSeek 模型,并推荐使用最新的 Flash 版本(对应 V4.1、代码 V4.1),把 API Key 复制填入后点击添加即可。
第三步:授权。 这一步 Mac 和 Windows 处理方式不同。

在苹果电脑上,需要授权 CC-HAHA 录制屏幕以及使用辅助功能。点击「电脑操控」的启用,确认开启后会弹出授权卡片,将应用拖拽进辅助功能授权列表;屏幕录制权限同理。授权完成后系统会提示重启应用,重启后看到两项均显示「已授权」即配置成功。Windows 用户则省去了授权环节,只需在电脑操控处安装相关依赖即可。
实际操作效果与模型差异
使用时新开一个对话,输入斜杠即可看到 computer use 选项,或直接用自然语言描述「使用操作电脑」也会触发对应的 skills,加载背后的功能。
演示中,UP 主让 AI 打开浏览器并在指定站点搭建一座小镇。过程中屏幕上会出现一个虚拟鼠标自动执行点击操作。一个实用的细节是:AI 操作时并不占用你的真实鼠标键盘,你甚至可以把窗口缩到后台继续做别的事,只要不退出应用,操作就会持续进行。

不过在模型选择上,视频也如实指出了明显差距。使用 DeepSeek Flash(便宜且支持多模态)时,computer use 的表现「稍微差了一些」,定位有时不够精准,操作不够顺畅。相比之下,接入 GPT6 这类国外顶级模型,搭建房屋等任务的完成效果会明显更好。

这反映出当前 AI 能力发展的一个不均衡现象:模型的代码能力、知识推理已经相当成熟,但「操作电脑」这项能力在不同模型之间仍存在较大鸿沟。UP 主的判断是,国内模型厂商在训练时应该会很快跟进 computer use 能力。
多模态能力(Multimodal)是 computer use 场景的核心门槛,指模型能同时处理图像与文本输入。DeepSeek Flash 虽支持多模态,但其视觉理解和界面元素定位的训练深度与专门针对 computer use 场景优化的模型相比仍有差距。Anthropic 的 Claude 系列(尤其是 Claude 3.5 Sonnet 及其后继版本)是目前公认在 computer use 任务上表现最稳定的模型之一,Anthropic 甚至为此专门定义了一套标准化的 computer use 工具调用协议。模型在这一任务上的表现差距,本质上反映的是视觉定位精度、长链任务规划能力以及错误恢复机制三个维度的综合差异——顶级模型在操作失败时能识别异常状态并重试,而能力较弱的模型往往会在出错后陷入循环或直接放弃任务。
小结
CC-HAHA 提供了一个门槛较低的方式,让普通用户体验 AI 自动操作电脑的能力:开源免费、跨平台、配一个模型就能跑。对于想尝鲜 computer use 的开发者和爱好者来说,这是一个不错的入门项目。
从技术层面看,computer use 的价值在于补齐「无接口软件」的自动化空白,而它的瓶颈也很清晰——高度依赖模型对界面的视觉定位与操作精度,目前仍是顶级闭源模型的优势区。据视频作者透露,下一步该项目还将介绍多 Agent 协作(Agent Teams)功能。项目完整信息可在其 GitHub 仓库获取。
多 Agent 协作(Agent Teams)是 computer use 能力的重要延伸方向:单个 Agent 在执行长流程任务时容易因上下文窗口限制或局部错误导致整体失败,而多 Agent 架构可以将复杂任务拆解为多个子任务,由专门的子 Agent 分别负责不同阶段(如一个负责信息检索、另一个负责界面操作),再由主控 Agent 协调整合结果。这种架构在工程实践中能显著提升复杂自动化任务的完成率和容错能力,也是当前 AI Agent 框架(如 LangGraph、AutoGen)重点探索的方向。对于 CC-HAHA 这类客户端来说,引入 Agent Teams 意味着用户可以将更复杂的跨软件、多步骤工作流交给 AI 完成,而不仅仅是单一界面内的操作。
相关推荐

Claude挑战循环真相:Wayfinder技能修复AI一次构建应用
解析Claude挑战循环(Challenge Loop)的运作原理与两大致命缺陷,以及如何用Matt Pocock的Wayfinder技能生成可验证规格文件,让AI代理一次性构建真实项目而非仅限游戏演示。

Claude Code 令牌耗尽?7个隐藏消耗点审计与修复指南
Claude Code 总是提前撞上令牌限制?本文拆解 Token 复合增长的底层机制,梳理从 /clear 到定时任务的七个隐藏消耗点,并澄清短提示、压缩、截图等无效省钱建议,附实用自查命令与审计方法。

MiniMax H3实测:3步采样打造整首歌口型同步MV
一位创作者用MiniMax H3 Extender制作整首歌口型同步MV的完整实测:音频切片、htdemucs人声隔离、fully_copy保留语法、3步turbo LoRA提速,附三款LoRA对比与自动化质检方案。