OpenAI Codex 上手指南:用AI代理构建并部署应用

一份 OpenAI Codex 实用速成指南,核心是用 Plan/Go 命令与技能系统把 AI 代理嵌入真实工作流。
本文整理自一位创作者的 Codex 速成课,系统梳理了这款 AI 编码代理的核心用法。文章从产品形态(已并入 ChatGPT 桌面端)、定价策略(20 至 200 美元多档,需注意 5 小时额度窗口)、插件与自动化生态,到最关键的 `/plan` 与 `/go` 两个斜杠命令,逐层展开。技能系统(`$` 调用)被着重介绍为将重复工作沉淀为可复用资产的核心机制。压轴实战演示用声控 Flappy Bird 串联了从需求澄清、代理自主编码、部署上线到 Expo 转移动应用的完整链路。文章最终指出:工具能力再强,没有合适的工作流围绕,只会产出低质量内容——方法论才是使用 AI 编程工具的真正门槛。
OpenAI Codex 被越来越多开发者提及,有人称它是用过最好的编码工具,也有人打开五分钟就关掉标签页,搞不清它到底特别在哪。这篇整理自一位B站UP主的中文配音速成课,试图厘清一个核心问题:Codex 到底该怎么用,才能发挥它作为自主编码代理的价值。
Codex 是什么:从独立应用到 ChatGPT 桌面端
Codex 本质上是一个自主的 AI 编码代理,能够读取代码库、执行命令、运行测试,并跨多种工具与环境完成软件工程工作流。它不只是一个聊天式助手,而是可以真正“动手”的智能体。
一个值得注意的变化是形态迁移。早期版本的 Codex 是独立应用,如今它主要以 ChatGPT 桌面应用的形式存在,可以在普通版 ChatGPT 与 Codex 之间切换。切换到 Codex 模式时更偏向软件相关任务,而 ChatGPT 模式又分为“聊天”与“work”两种用法——后者适合把多个文件压缩整合成一个工作单元处理。
尽管形态变了,核心功能保持一致:插件、定时任务、新建聊天、项目管理都还在,迁移过程几乎无缝。

"AI 编码代理"(Coding Agent)与传统代码补全工具(如早期的 GitHub Copilot)有本质区别。代码补全工具停留在"建议"层面,需要人类逐行确认;而代理(Agent)具备自主规划与执行能力——它可以分解任务、调用工具、读写文件、运行终端命令、解析测试报告并据此自我修正,形成一个完整的"感知-决策-执行"循环。OpenAI 的 Codex 所采用的底层模型针对软件工程任务专门优化,支持在沙箱环境中实际运行代码,这使它能处理跨文件、跨工具的复杂工作流,而不仅仅是在光标处插入一行代码。
价格与账号:从免费到 200 套餐
价格是很多人关心的问题。据这位创作者介绍,即使是免费账号也能用上 GPT 5.5,只是有使用限制。付费层级大致分为约每月 100 美元的 Pro 版和 200 美元的高阶套餐。
他坦言自己一开始选了 200 美元套餐,属于中度使用,几乎从未触及限额,甚至出现过额度滚存重置的情况。事后回看,如果早知道用量情况,选择 100 美元或更低层级就足够了。
后来他转向了 20 美元的套餐,配合 Token 优化,日常使用体验依然不错。唯一的缺点是:一旦用完每周或每小时额度需要充值,在 5 小时的间隔窗口内充 20 或 50 美元时,额度消耗会比预期快得多。这个“5 小时限制”是需要提前规划的关键。

自动化与插件:把代理接进你的工作流
Codex 的“影子任务”(Shadowed/自动化)是最容易被低估的能力。你可以让它按小时、按天定时运行任务,比如每天早上给老板发邮件、寻找潜在客户、收集内容创作灵感、通过 WhatsApp 发消息等。创建方式很简单:通过聊天描述需求即可生成一个自动化流程。
插件生态则是编码场景的关键。支持的连接器包括 Supabase、Notion、Figma、Vercel、GitHub、Gmail 等。这位创作者主要用 Supabase 做身份验证与受保护路由,用 Notion 存储上下文。
他分享了一个实用心得:不要把上下文都堆在 AI 代理或聊天窗口里。处理大型代码库时上下文会迅速膨胀,超出上下文窗口后代理容易“遗忘”。更稳妥的做法是把相关信息存进 Notion,需要时让 AI 去取用。这是应对长期项目的一个务实思路。
上下文窗口(Context Window)是大语言模型单次能处理的文本总量上限,以 Token 计量。对于大型代码库,仅头文件、依赖声明和业务逻辑文件加在一起就可能轻易突破限额。一旦超出,模型会出现"遗忘"现象——早期载入的代码结构、变量约定或架构决策会从有效记忆中消失,导致后续生成的代码与已有部分不一致甚至相互冲突。将项目背景、架构说明和关键约定外置到 Notion 等工具,让代理按需检索,本质上是用「外部存储」绕过模型内置记忆的物理限制,是长期维护大型项目时的必要工程实践。
模型选择与权限控制
工作区是使用 Codex 时停留最久的地方。模型选择器提供多档选项,其中旗舰模型能力最强,被认为可与 Cloud Code 系列媲美;中等档位性价比适中;还有更便宜、更经济的轻量选项。
除模型外还能设置 Effort 参数,从 Light 到 Ultra。Ultra 会消耗大量 Token 并产出更好结果,但多数场景并不需要。创作者个人偏好 Extra High 或直接保持 Medium,实测 Medium 做出来的设计已经相当不错。速度可在标准与快速间切换,快速模式生成更快但更费 Token。
权限方面有三种主要模式。默认会在需要运行终端命令、访问互联网或外部文件时请求批准;“为我批准”会在检测到潜在风险命令时提醒;也可以选择完全访问权限。创作者选择了全开放,但特别提醒:这样做需要谨慎,最好在没有重要数据、出问题也损失不大的机器上操作。
核心中的核心:Plan 与 Go 两个命令
如果说整门课只需记住一件事,那就是 /plan 和 /go 这两个斜杠命令。据创作者估算,Codex 上大约 80% 的工作都围绕它们展开。
计划模式(Plan) 会带你走完整个思考过程。你只需像平时那样自然描述想构建的东西,比如一个家务管理应用或卡路里追踪应用。Codex 会尝试理解你的愿景,如果存在冗余或不清楚之处,它会分轮次提问——第一轮大约两个问题,逐步澄清意图。理解到位后,它整理出一份实施计划交给你审阅,满意就推进,不满意可只修改需要调整的部分。
目标模式(Goal) 则适用于你心中已有明确终点的情况。你不是让 AI 去思考项目,而是直接告诉它最终结果应该是什么。比如构建一个领英档案扫描器:应用应能接受领英链接、分析档案、推荐修改建议。Codex 会围绕这些目标持续迭代,直到所有指标都实现后再展示成果。
两者不能同时开启,一次只能切换其一。创作者的常用流程是:先用 Plan 模式让 Codex 分析、提问、给出实施方案,再把方案复制出来用 /go 命令发送,让它持续运行直到目标达成,最终得到一个 MVP。

技能系统:把重复工作沉淀为可复用资产
技能(Skill)通过美元符号 $ 调用,是应对重复性工作的利器。创作者演示了一个“价值百万的编辑技能”:Codex 把某套设计方法整理成一个 .md 文件保存为技能,之后每次调用都会加载这份指令,从而稳定复现同样的输出效果。
典型用例是团队沟通场景。他每月需要向团队同步 YouTube 频道数据——联系合作人数、付费赞助、各细分领域细节等。把偏好的设计固化为技能后,只需让 Codex 提取频道数据、套用这套设计生成报告即可,还能进一步自动化,比如设定每月 27 号自动发送给团队。
技能有两类来源:一是用户自己创建或 Codex 在执行任务时自动创建的个人技能,二是系统自带能力(如图像生成)。此外,斜杠命令 / 用于提及内容、@ 符号用于对话中引用、$ 用于调用技能,三套语法分工明确。
技能文件(.md 格式)本质上是一种「提示词模板的持久化」机制。Markdown 格式便于人类阅读与编辑,同时也是大语言模型天然理解的结构化文本格式,因此既可作为文档供人维护,又能直接作为系统提示或上下文注入模型。这与软件工程中「配置即代码」(Configuration as Code)的理念异曲同工:把散落在对话窗口里的一次性指令沉淀成版本可控、可复用的资产,降低团队协作的认知摩擦,也避免每次重新"教"模型同一套规范。
实战演示:用声音操控的 Flappy Bird
课程压轴是一个实战项目——开发一款“声控版 Flappy Bird”。不同于原版点击操作,这个版本用声音代替点击:玩家需要持续发声,让小鸟在重力作用下保持飞行、穿越管道。
创作者用 /plan 发送了“构建一个 Flappy Bird 游戏”的需求,Codex 分三轮提问澄清需求,每轮约三个问题并提供可选方案。确认语境后给出实施方案。他随后复制方案、用 /go 命令发送,让它自主运行——整个过程约耗时 23 分钟,Codex 期间编辑了多个文件,还生成了游戏封面图。

首版存在小问题,但基本可玩。项目最终通过 Codex 的“站点”功能部署到 ChatGPT 托管基础设施,生成一个可访问链接,还带有流量数据分析等指标,类似一个真正的网站仪表板。
更进一步,创作者把项目开源到 GitHub 仓库,附带用户友好的 Readme 和一段“Expo 转换提示”。这段提示可直接粘贴到 Codex 或 Cloud Code 中,把网页应用转换成同时兼容 iOS 与 Android 的真实移动应用。之后注册 App Store 开发者账号(每年 99 美元)或 Google Play 账号(25 美元)即可发布变现。
他特意提醒:不要原样发布同一份代码,否则 App Store 会将其视为规避手段而拒绝——建议在此基础上做出自己的差异化。
Expo 是一个基于 React Native 的开发框架,允许开发者用一套 JavaScript/TypeScript 代码同时构建 iOS 和 Android 应用,无需分别维护原生代码库。将网页应用(基于 HTML/CSS/JavaScript)转换为 Expo 项目需要重写渲染层和平台 API 调用,但核心业务逻辑通常可以复用。文中提到的「Expo 转换提示」是一段精心设计的提示词,指导 Codex 自动完成这一迁移工作——这也是技能系统价值的典型体现:把一次性调试出来的有效提示词固化下来,变成可反复调用的转换管线。
从入门到生产:工作流才是关键
创作者在结尾坦承,这门课只覆盖了 Codex 的基础,并未展示真正的工作流。他的观点很直接:这些工具本身能力极强,但如果没有合适的工作流围绕,最终会产出大量低质量内容,或陷入“寄希望于每次提示词都命中”的循环。
对于想构建面向真实用户的生产级系统的人来说,工作流不是可选项而是必需品。这一判断也点出了当下 AI 编程工具的普遍困境:能力越强,越考验使用者的方法论。
对普通开发者的启示或许是:与其追问 Codex 是不是最好的工具,不如先想清楚自己要用它解决什么问题、如何把重复流程沉淀成技能与自动化,让代理真正嵌入日常工作,而不是停留在“打开五分钟就关掉”的猎奇阶段。
相关推荐

Gemini Live API重磅更新:原生音频首次支持前沿级推理
Gemini Live API迎来重磅更新:主动式音频、上下文注入、异步函数调用四大功能落地,更首次将前沿级高阶推理引入原生音频体验,为语音AI应用带来突破。

自托管Whispersync:让电子书与有声书进度自动同步
Concordance是一个开源自托管Whispersync方案,通过KOReader、Calibre-Web-Automated和Audiobookshelf实现电子书与有声书进度双向同步。采用分层强制对齐与字符级定位,MIT许可,适合自托管电子书爱好者。

陶哲轩:数学不止是证明,我们该如何看待其余部分
菲尔兹奖得主陶哲轩撰文指出,数学远不止于证明,提出问题、构建概念、阐释直觉等工作同样重要却被低估。在AI辅助证明兴起的当下,重新认可这些贡献关乎数学的未来定位。