WorkBuddy零基础实战教程:AI办公自动化全流程落地

WorkBuddy是AI调度工作台,Codex是代码专项Agent,本文用四步流程带你跑通第一个AI办公任务。
本文以B站UP主的实战教程为基础,厘清了WorkBuddy与Codex的本质差异:前者是面向日常办公的AI调度工作台,可调用DeepSeek、Kimi等多款国产大模型完成任务拆解、文件读写和办公软件联动;后者是OpenAI基于GPT-5深度微调的代码专项Agent。文章重点介绍了WorkBuddy的界面构成、写指令的「四要素法」(目标、输入、输出格式、约束)、工作空间与安全沙箱配置,以及如何在右侧栏查看产物、变更对比和继续修改。整套流程仅需四步,旨在帮助零基础用户将日常办公自动化真正落地。
全网都在讨论 WorkBuddy 和 Codex,很多人把两者混为一谈,认为它们差不多——都能写文案、整理资料,甚至做点开发工作。但如果只盯着这些重叠的功能去比较,永远搞不清它们的真正差别。这篇文章从一位 B站 UP主分享的保姆级实战教程出发,带你厘清 WorkBuddy 的定位,并跑通第一个真实的 AI 办公任务。
WorkBuddy 与 Codex 到底谁是谁
一句话结论:WorkBuddy 更像一个已经上岗的 AI 办公同事,Codex 更像一个和你一起搭工具的 AI 程序员。前者擅长帮你把眼前的工作做完,后者擅长把重复的工作做成一套可复用的工具。
这不是说 WorkBuddy 不能开发、Codex 不能写报告,两边能力有重叠,但最擅长解决的问题不一样。
WorkBuddy 并非自研大模型,可以理解为一个 AI 调度工作台。它能自由切换 DeepSeek、Kimi、MiniMax 等多款第三方国产大模型,内置了大量 Skill 技能。它做的核心工作是任务拆解、本地电脑操控、文件读写、办公软件联动,再把指令分发给不同模型执行——它本身只是中间的调度层,算力和推理完全依赖接入的外部模型。
而 Codex 是 OpenAI 基于 GPT-5 系列深度微调的代码专项模型加软件工程 Agent,训练数据以海量开源代码、工程文档、调试日志为主,优化目标只有写代码、读仓库、调 bug、后端工程化开发。

AI Agent 是近年兴起的概念,指能够自主规划步骤、调用工具、并持续执行直到完成目标的 AI 系统——区别于只回答单轮问题的普通聊天模型。WorkBuddy 和 Codex 都属于 Agent 范畴,但两者的「工具箱」截然不同:WorkBuddy 的工具是文件系统、办公软件、桌面操作;Codex 的工具是代码执行环境、Git 仓库、终端命令。这也解释了为什么同样能「写东西」,两者的适用场景却差距悬殊——工具决定了 Agent 能触达的边界。
认识 WorkBuddy 的操作界面
打开软件后界面分两块:左边是侧边栏,右边是主操作区。中间那个大输入框是核心,你要它做的事用一句话写在这里就行。提示语写着「今天帮你做些什么」,支持 @ 引用对话文件、斜杠调用技能与指令。
右下角可以选模型,每个模型后面的倍率就是积分花费比例,数字越小越省。像 H3 这类现在限时免费,日常任务完全够用;复杂的活挑 Kimi-K2 这种倍率高的强模型;拿不准就用默认的 Auto 让它自动调度。
输入框上方有三种模式:日常办公、代码开发、设计创意,点哪个下面的场景入口就跟着换。日常办公这一排包含文档处理、金融服务、数据分析可视化、深度研究、视频生成、换幻灯片、产品管理,这门课主要用日常办公。
输入框左下角的加号可以添加文件,也能手动指定模式、专家、技能、连接器。专家里有内容创作专家、微信小程序开发者、涉外合同法务专家等各领域角色,还可召唤更多专家。

左侧侧边栏从上往下依次是:新建任务、助理(在手机上远程指挥电脑干活)、项目(团队协作用)、专家技能连接器的管理中心、自动化配置(定时自动跑的任务),再往下的「更多」放着资料库和灵感。灵感是个成品广场,看到喜欢的可以一键做同款。下面一大块是任务列表,跑过的每个任务都存在这里。
值得留意的是,WorkBuddy 是纯图形界面软件,没有命令行接口,所有操作都在这个窗口里完成,这也是它比 Codex 对新手友好的地方。
四要素法:把指令写清楚
很多人不知道指令怎么写。教程给出了四个要素:
- 目标:你要它做成什么
- 输入:给它什么材料
- 输出格式:Word、Excel 还是别的
- 约束:风格、字数等要求
四个要素说清楚,结果基本一次到位。以一个真实例子演示:在输入框里写「帮我把客户反馈.txt 整理成 Excel 表格,按问题类型和严重程度分类,加一行汇总」。这里目标、输入、输出格式、约束四个要素都齐全了。

发送前可以看输入框右边的小图标:星星是「增强提示词」,指令写得潦草它帮你补全润色;中间 auto 是模型调度,保持默认即可;旁边的麦克风支持语音输入,不想打字就说话。

配任务:工作空间与安全权限
写完指令后要配任务。先点「选择工作空间」告诉它在哪个文件夹干活。新建工作空间会在本地自动建一个同名文件夹(默认在 C 盘用户目录下的 WorkBuddy 目录里)。建议一类任务一个空间,干净又安全。
给材料最省事的办法是把文件直接放进工作空间文件夹,它自己就能找到;也可以点加号添加本地文件或腾讯文档。
执行方式上,默认模式界面写着「可高效执行并完成任务」,即直接干活。下面两个开关:开「问答」它只回答不动文件;开「计划」先给方案,确认后再动手。新手保持默认,复杂任务建议开计划。
WorkBuddy 的安全沙箱有三层保护:命令先在沙箱里跑,拦住了再问你;删除走回收站,不会直接抹掉;改已有文件前会自动留备份。那个「允许完全访问」开关一旦打开就什么都不问直接执行,新手一律保持默认别动。
安全沙箱(Sandbox)是 Agent 类软件的标配安全机制。由于 AI 会自主生成并执行代码或系统命令,沙箱的作用是在命令真正触及操作系统之前,先在隔离环境中模拟运行,拦截潜在危险操作。WorkBuddy 的三层保护——沙箱拦截、回收站中转、自动备份——本质上是在「自主执行」和「用户控制」之间建立缓冲地带。这类设计在面向非技术用户的 Agent 产品中尤为重要,因为用户往往无法预判 AI 的每一步操作是否安全。
收结果:产物、预览与变更对比
点发送后任务开始执行,界面跳转到任务花页。它的工作方式清晰可见:先深度思考读取客户反馈文件、理清分类逻辑,然后加载表格技能编写脚本开始干活,每一步都列在界面上,整个过程一两分钟。
右侧栏是收结果的地方。顶部下拉默认停在「概览视图」,还能切换其他视图。下面的产物区放着本次任务新生成的文件,做好的 Excel 会自动打开——分好列、标好色、汇总行都到位。
切到「工作空间文件」视图,能看到文件夹里所有文件,原始材料和成品一目了然。还有「变更视图」会记录对已有文件的每一处改动,能对比改动前后。做网页类任务时,「浏览器」视图可直接预览效果。
想改也很方便:直接在对话里补一句「严重程度这一列改成高中低三档」,它会在原表格上修改而非推倒重来,改了什么也列得清清楚楚。文件直接覆盖更新,即便关掉窗口也不怕丢——左边任务列表里这个任务一直都在,随时点开回到现场。
小结
跑通一个 WorkBuddy 任务只需四步:写指令(目标+输入+输出格式+约束四要素)、配任务(选空间、选执行方式、权限保持默认)、看执行(过程透明可追踪)、收结果(右侧栏产物、预览、变更对比、取件)。
这套流程降低了 AI Agent 的上手门槛,让零基础用户也能把日常办公自动化落地。全套课程分为 10 节 WorkBuddy 和 14 节 Codex,本文覆盖的是第一期界面认知与首个任务实战,后续技能安装才是真正让它替你干活的关键。
相关推荐

AI早报:千问全模态Qwen3-Omni发布,华为昇腾960与Grok新模型齐现身
9月18日AI早报:千问推出原生全模态模型Qwen3-Omni Flash,音视频成本降超93%;华为披露百万级处理器计算架构并传昇腾960将发布;Grok新版现身谷歌云,OpenAI推ChatGPT for Word,N8N爆满分漏洞。

小米MiMo-V2.6直播训练:一天半烧850万,每秒约10美元
小米MiMo大模型团队直播MiMo-V2.6 Pro/Flash的强化学习训练过程,一天半已花费约855万人民币,每秒烧约10美元。本文解析其三方向算力扩展路径、开源计划与DeepSWE基准跑分对比。

字节Trae Work上手指南:11个应用场景解析
字节通用AI agent产品Trae Work上手指南,详解Work、Code、Design三大板块及PPT生成、数据分析、深度研究、代码开发等11个应用场景,帮零代码用户快速判断如何用它解决实际问题。