Codex保姆级教程:9大模块玩转AI编程工作台

OpenAI Codex是从「问答」进化为「执行任务」的AI编程智能体工作台,支持文件操作、插件调用、自动化与外部系统连接。
本文系统介绍了OpenAI推出的AI编程工具Codex的核心能力与实战用法。与普通AI问答助手不同,Codex拥有真实的持久化工作区,能读取文件、运行命令、调用插件,真正「完成任务」而非仅「回答问题」。文章从安装入门、Chat与Project模式区分、模型与权限配置,到插件市场(Word/Excel/PPT)、Plan规划模式、Skill操作说明书、MCP外部服务连接,以及定时自动化与Computer Use电脑操控,覆盖了9个核心模块。作者特别强调权限管理的谨慎原则,并指出真正用好Codex的关键在于将任务描述清晰,而非记忆功能按钮。这代表AI工具从「问答」向「执行」演进的重要趋势。
Codex是什么:从「回答问题」到「完成任务」
AI编程时代,真正能大幅提升开发效率的工具正在从「问答助手」进化为「智能体工作台」。OpenAI推出的Codex,正是这一趋势的代表产品。
用一句话理解Codex:它是OpenAI推出的AI编程与智能体工作台,最大的价值在于把AI从「回答问题」推进到「完成任务」。
普通AI工具更像问答助手——你问一个问题,它给你一个答案,比如写文案、做内容总结。而Codex更像一个能进入项目真实目录、读取资料、修改文件、运行命令、调用插件的助手,最终生成可检查、可继续修改的结果。你可以把它理解成「能参与工作流程的助手」,不仅提升编程效率,日常办公、学习、写作场景同样受益。
本文根据B站UP主的22分钟保姆级教程整理,从9个模块系统拆解Codex的核心能力与实战用法,适合零基础用户从入门到进阶。
安装与界面:新手只需记住三个区域
安装Codex和普通软件类似:打开官网,点击下载,选择对应系统版本。首次打开时用ChatGPT账号登录即可。
登录后不要急于点击所有按钮,新手只需牢记三个核心区域:
- 左侧导航区:查看新建的聊天、项目、插件市场、自动化入口
- 中间对话框区:给Codex下达任务、上传附件、选择模型和推理等级
- 右侧结果区(场务区):显示文件、预览页面、生成结果
一个适合新手的入门案例:新建空白项目后,输入提示词「帮我创建一个Markdown文件,用三句话解释Codex和普通聊天工具的区别」。你会发现,它不只是在聊天框里回答,而是真正在项目目录下创建了一个新文件。这正是后面所有能力的基础——Codex拥有一个可以持久操作的工作区。

Chat与Project模式:临时对话 vs 持久化工作
Codex有两种重要的工作方式,理解它们的区别是用好这款AI编程工具的第一步。
Chat模式:临时问问题
Chat更像普通聊天,适合临时性、一次性的提问。比如输入「解释一下MCP是什么」,它会像普通AI工具一样直接给出回答。这类任务不需要长期文件,也不需要在本地产生持久化结果,用Chat即可。
Project模式:正式任务产出成果
Project则适合正式任务——只要这个任务会产生文件、需要读取资料、持续修改、运行命令、写代码或调用插件,就建议用Project。例如「把当前文件移动到当前目录下」这类操作,Codex会在真实目录中完成,并把结果呈现在结果区。
简单总结:Chat是临时对话,Project是会产生持久化结果的工作。做网页、修改PPT、做表格、写代码,都推荐使用Project模式。无论哪种模式,都可以右击重命名,并查看真实的工作目录。
「持久化工作区」的概念是理解Codex与普通AI聊天工具本质区别的关键。普通AI对话是无状态的——每次对话结束后,AI不保留任何文件或操作记录。而Codex的Project模式维护一个真实的文件系统沙箱:所有生成的文件、安装的依赖、执行的脚本都保存在项目目录中,下次打开时状态完全保留。这类似于在云端拥有一台始终在线的开发机,而非每次都从零开始。这也是为什么「做网页」「写代码」这类需要多轮迭代的任务必须用Project模式——只有持久化的工作区才能支撑「上次生成的文件→这次继续修改→下次测试部署」这样的完整工作流。
模型、推理等级与权限:新手用默认配置最稳妥
这是Codex使用中容易被忽视但至关重要的三个设置项。
选择合适的模型
模型是Codex的「大脑」。在输入框右下角可以看到多个版本,不同模型在速度、推理能力、成本和适合任务上各有差异。新手无需纠结,选择默认模型即可完成大部分任务。
调整推理等级
推理等级分为低、中、高、超高。等级越高花费时间越多,越适合复杂任务,比如规划大型项目、分析大量文件。此外还有速度选项:快速模式比默认速度快1.5倍,但Token用量会翻倍。
谨慎设置权限
权限是最需要谨慎对待的部分。Codex执行任务时可能读文件、写文件、运行命令、联网、安装依赖甚至操作浏览器和电脑,这些动作都需要授权。
这里有一个重要提醒:权限不是越高越好。权限越高Codex越自由,但你需要看清它到底做了什么。建议新手前期使用「默认权限」或「自动审查权限」,遇到弹窗不要无脑点击,先看清它访问哪里、要执行什么命令。

实测案例中,当指令要求在Download目录(当前项目目录之外)创建TXT文件时,Codex会弹窗请求授权——这说明默认状态下它只能访问当前目录,越界操作必须经过确认。若选择「自动审查」,Codex会自动判断操作危险等级,低危操作自行确认,高危操作才请求授权。
插件市场:给Codex装上专业工具箱
Codex的Plugins可以理解成工具箱,安装后它就能处理更专业的任务。
以「办公三件套」为例:
- Documents插件:创建和编辑Word文档
- Spreadsheets插件:处理Excel表格
- Presentations插件:生成和修改PPT
实战演示
准备一份「AI工具学习资料」文档,给出提示词「帮我把这个文档整理成三种产物:一个Word学习笔记、一个Excel工具对照表、一份PPT课程大纲」。Codex会自动调用对应插件,一次性生成三种格式的文件。
除了让Codex智能判断,你还可以显式调用插件——点击加号选择插件,再给出文案,它就会用指定插件生成产物。

Plan模式:复杂任务先规划再执行
当任务比较复杂时,直接让Codex动手往往得不到理想结果——技术栈、代码结构、页面风格都可能与预期偏差。这时就该用Plan模式。
Plan模式遵循「理解→拆解→确认→执行」四步流程。它的核心不是「慢一点」,而是让Codex先把任务拆开,告诉你准备怎么做,你确认后它再执行。
如何开启Plan模式
点击加号选择「计划模式」。以「做一个个人博客」为例,Codex会先弹框让你选择博客定位、实现方式、视觉风格,然后列出完整计划。你满意后点击「实施此计划」,它才会生成静态博客页面。
Plan模式适合对结果有明确要求、不希望AI自由发挥的场景——它先规划再执行,不会上来就修改代码。
Skill与MCP:教它怎么做,让它连接外部服务
这是两个容易混淆但功能互补的高级能力。
Skill:Codex的操作说明书
Skill就像一份操作说明书,告诉Codex执行某类任务应遵循哪些步骤、注意哪些规则、使用哪些资源。比如生成图片有图片Skill,处理文档有文档Skill,测试网页有测试Skill。GitHub上有大量现成的Skill,覆盖开发、产品、写作、数据分析等场景。
安装方式有多种:
- 官方推荐的直接点击安装
- 通过终端复制第三方Skill命令回车安装
- 点击「Skill Create」自己创建,描述自己的工作流程
MCP:连接外部工具的标准接口
MCP是连接外部工具和服务的标准接口,让Codex能连接浏览器自动化、数据库、设计工具、项目管理等更多外部系统。
配置方式也很简单:通过 codex mcp add 命令加上MCP地址即可安装;或者更简单地在输入框直接说「帮我安装Figma MCP」,它就能自动完成。

实战演示中,安装Figma MCP后,给出提示词让Codex读取Figma设计稿,它成功读取了设计稿并识别出对应的标题元素。这就是让Codex连接外部服务的价值所在。
一句话区分:Skill是教Codex「怎么做」,MCP是让Codex「能连上外部系统」。
MCP(Model Context Protocol)是由Anthropic于2024年底提出并推动的开放标准协议,目标是为AI模型与外部工具之间建立统一的通信规范。在MCP出现之前,每个AI应用若想连接数据库、设计工具或浏览器,都需要为每种工具单独开发适配层,成本高且难以复用。MCP定义了一套标准化的「工具描述+调用+返回」格式,使得任何遵循该协议的外部服务都能被支持MCP的AI直接调用——类似于USB接口统一了外设连接标准。目前主流AI编程工具(包括Claude、Cursor、Codex等)均已支持MCP生态,GitHub、Figma、Notion、Slack等平台也陆续推出了官方MCP服务端,这意味着Codex理论上可以通过MCP接入数百种外部系统,而无需等待OpenAI逐一适配。
自动化与Computer Use:重复劳动交给AI
Automations:定时重复执行任务
自动化解决的是「有些任务不止做一次,而要重复做」的痛点,比如每天生成数据简报、每天获取AI最新新闻。其本质是让Codex在指定时间或间隔自动执行任务。
演示中,输入「每天晚上8点去社交平台获取Codex的新闻或更新并生成简报」,Codex便自动设置好定时任务。在自动化面板中,可以查看任务状态(活跃/暂停)、下次运行时间、运行环境和推理模型,也能手动执行、暂停或删除。不过新手不建议一上来就折腾自动化。
Computer Use:授权后直接操作电脑
Computer Use是Codex的一类「超能力」——授权后可以操作电脑,在软件中点击、输入、截图、读取界面信息。演示中,通过Computer Use让Codex「打开电脑国际象棋并与电脑对战」,它成功控制了整局对战。
但这类能力权限极高,新手务必谨慎使用。
Computer Use(计算机使用)能力的底层原理是「视觉+操作」的结合:AI通过截取屏幕画面来「看」当前界面状态,再生成鼠标点击坐标、键盘输入序列等底层操作指令来与界面交互。这与传统的RPA(机器人流程自动化)工具(如UiPath、AutoHotkey)有本质不同——RPA依赖提前录制的固定操作路径或UI元素ID,一旦界面变化就会失效;而基于视觉的Computer Use能理解界面语义,遇到弹窗或布局变化时能自主调整策略。这种灵活性使其适合处理界面不固定的任务,但同时也带来安全风险:AI的操作判断可能出错,在未经确认的情况下执行破坏性操作(如删除文件、提交表单)。因此在正式工作环境中使用前,强烈建议在隔离的测试账号或虚拟机环境中先行验证。
结语:用好Codex的关键在于「说清楚」
真正用好Codex的关键,不是记住每一个按钮,而是学会把任务说清楚:要它做什么、参考什么资料、最后怎么检查结果。
只要掌握了这个思路,无论是在写作、办公、学习还是编程场景,Codex都能帮你节约大量重复劳动。它代表的是AI工具从「问答」走向「执行」的必然趋势——而理解并驾驭这一趋势,正是每个开发者和知识工作者的新课题。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。