Codex保姆级教程:从安装到实战全流程详解

Codex是什么:一个会动手的AI助手
OpenAI推出的Codex常被拿来和ChatGPT对比,但两者有本质区别。有个精妙的装修比喻可以帮助你理解:如果你请ChatGPT帮忙装修,它会详细告诉你灶台该往左移、吊柜该刷什么颜色,说得头头是道——然后就没有然后了,所有活儿还得你自己干。而Codex则会自己量尺寸、画图纸、搬灶台、刷漆,完工后还拍照让你验收。
这正是「AI Agent」和「问答机器人」的核心差异。所谓AI Agent,是近两年AI领域最重要的范式转变之一。传统大语言模型本质上是文本生成器——接收输入、产出文本,交互到此为止。而AI Agent在此基础上增加了感知环境、制定计划、调用工具、执行动作、观察结果并迭代修正的完整闭环能力。这一概念源自强化学习中的「智能体」定义,2024年以来随着函数调用(Function Calling)、工具使用(Tool Use)等技术成熟,Agent架构开始从学术走向产品化。Codex正是这一浪潮中最具代表性的产品之一——它能够直接打开你电脑上的文件夹、创建文件、运行程序、上网搜资料、操作浏览器,改完还能自己提交代码仓库、部署上线。它虽然从编程出发,但现在已经进化成一个能写代码、做PPT、做Excel、写Word报告、操作浏览器甚至制作视频的全能助手。
更关键的是,它支持多个「工人」分头干活——一个刷厨房、一个装浴室、一个修客厅灯,全部在后台并行进行,互不打扰。这种自主动手能力,是Codex区别于传统AI工具的最大价值。
四种使用方式与安装准备
Codex提供四种使用形态:命令行版(CLI)、VS Code插件版、桌面客户端和网页版。四者性能一致、功能大部分重叠,但综合考虑使用难度、功能全面性和新手友好度,桌面客户端是首选,本文也主要围绕它展开。
安装前需要准备一个ChatGPT账号,建议开通Plus或Pro会员。虽然免费账号现在也能用Codex,但额度非常少,用不了几次就耗尽。Plus用户每5小时可发送30到150条消息,日常使用基本够用;重度用户或企业场景可考虑额度更高的Pro。
相比同类工具Claude Code,Codex有两个显著优势:额度更充裕且频繁重置,有时甚至因为很小的原因就给你重置额度;同时对账号的限制更少,不像某些工具那样容易封号。
登录方式选择
登录方式有两种。推荐用ChatGPT账号直接登录——消息额度直接用订阅配额、第一时间用上最强模型、解锁云端任务等高级功能。另一种是用API Key登录,但模型更新慢、云端任务不可用、按量付费成本可能更高。结论很明确:除非有特殊原因,直接订阅Plus用ChatGPT账号登录是性价比最高的方案。
界面详解:项目、对话与权限模式
登录后,左侧栏包含新对话、搜索、插件、自动化四个功能按钮,以及项目和对话两个核心列表。理解这两者的区别至关重要:
- 对话类似网页版ChatGPT聊天,适合搜集资料、写文案、翻译、答疑等琐碎工作;
- 项目则对应你电脑上的一个文件夹,所有生成的文件、代码、PPT、Excel都会保存在这里,方便管理不丢失。
简单记忆法则:但凡涉及生成文件就用项目,只是随便聊聊就用对话。每个项目下可以有多个对话,一个对话处理一件事,可以理解为「项目是大文件夹,对话是文件夹里的工作线程」。
三种权限模式
由于Codex能直接操作你的电脑,权限管理成为关键概念,共三种模式:
- 默认权限(最安全):只能在当前项目文件夹内修改,涉及联网、运行命令、访问外部文件都必须征得你同意,适合新手;
- 自动审查:Codex自评风险,安全操作自动通过,有风险的才询问,相当于配了个内部审批员;
- 完全访问权限(最高):可做任何事且全程不询问,效率最高但有误删风险。
建议循序渐进:新手第一周用默认权限,第二周尝试自动审查,非常熟悉且项目有Git备份后再考虑完全访问。

模型选择与核心操作技巧
在输入框右下角可切换模型和思考强度。推荐将GPT 5.5作为默认首选,它在复杂代码编写、重构、调试方面表现最好;GPT 5.4 mini适合简单快速任务、省额度;专为编程优化的GPT 5.3在某些复杂工程任务上依然强劲。
思考强度设置
思考强度分低、中、高、超高四档:
- 低:几乎不思考直接回答,适合改拼写等简单操作
- 中:默认推荐档位,平衡速度与质量
- 高:适合有复杂度的功能开发
- 超高:想得最深最慢,适合普通模式反复搞不定的诡异Bug
日常高频操作
日常高频操作有三种:
- 任务排队:Codex执行任务A时,你可以直接输入新任务B,它会排队按顺序执行;
- 任务插队:点击消息旁的引导按钮,可将新要求直接注入正在执行的任务,让AI边做边调整;
- 多任务并行:开新对话即可让多个任务同时跑,甚至跨项目并行。需注意不同对话间上下文不共享,但它们都能读取同一项目文件夹的文件。
此外,模型标签旁的小圆圈表示上下文窗口使用比例。GPT 5.5约有256K上下文(几十万汉字),且Codex会自动压缩过长对话,无需手动处理。这里值得深入理解一下上下文窗口的概念:上下文窗口(Context Window)是指模型在单次对话中能「看到」和「记住」的最大文本量,以token为单位计量。早期GPT-3.5仅有4K token窗口,约等于3000个汉字,稍长的对话模型就会「忘记」前面内容。256K token则约等于数十万汉字,接近一本中等篇幅的书。窗口扩大的背后是稀疏注意力机制、滑动窗口注意力、RoPE位置编码外推等技术的进步。不过窗口大不等于利用效率高——研究表明模型对窗口中间部分的信息检索能力(即「大海捞针」问题)仍有衰减,因此Codex的自动压缩机制非常必要,它会智能地保留关键信息、丢弃冗余内容,让有限的窗口空间发挥最大价值。
插件与技能:全能助手的生态基础
很多人搞混「插件」和「技能」,其实区别很简单:
- **技能(Skills)**是一套写好的执行步骤,打包成Markdown文件。比如生图流程「确定描述→选风格→调模型→输出」写成一个文件即为一个技能。可理解为「一份说明书」;
- 插件则大一个级别,包含多个技能加上与外部应用的连接能力。比如内置的computer use插件可接管电脑,内含操作App、屏幕录制、键盘操作等多个技能。
触发方式
输入@可指定调用插件,输入$可触发技能。一条消息里可同时使用,例如「帮我分析AAPL股票情况使用@documents,总结成Word报告,并使用$image生成封面图」。
办公场景应用
借助插件生态,Codex可完成大量办公工作:
- 生成Word:用document插件,自动联网搜资料、整理分析,生成带目录、表格、结论的文档;
- 生成Excel:用super sheets插件,生成带颜色标注的对比表格;
- 生成PPT:用presentation插件,生成简洁商务风格、每页有要点配图的演示文稿。
更强的是可以一条指令同时生成Word、Excel、PPT和封面图,全部保存到项目文件夹。

进阶功能:自动化、工作树与终端
对于每天重复的任务(如每天出股票分析报告),可用自动化功能。直接用自然语言告诉Codex「每天早上9点自动搜索AI股票信息、生成报告和PPT」,它就会创建定时任务。提醒一点:首次使用前先在普通对话里试跑一遍指令,确认结果符合预期再设为定时任务,否则会白白浪费额度。
三种环境模式
环境模式有三种:
- 本地模式:直接改你电脑的真实文件,适合小修改,但需养成备份习惯;
- 工作树(Worktree)模式:Codex在后台创建平行副本干活,完全不动原文件,适合多AI同时修改避免冲突。改完可选择合并、创建新分支或直接扔掉。就像「复印合同给两个律师分别修改」一样;
- 云端模式:任务发到OpenAI服务器执行,电脑无需常开,适合耗时大任务,但配置较复杂,新手可暂时不管。
这里的工作树(Worktree)概念值得展开说明。它是Git版本控制系统的一个高级功能。Git是目前全球最主流的分布式版本控制系统,由Linux之父Linus Torvalds于2005年创建,核心思想是为项目的每次变更创建快照(commit),使得任何修改都可追溯和回退。Worktree允许在同一仓库下同时检出多个工作目录,每个目录对应不同分支,互不干扰。这对AI Agent场景特别有价值——多个AI助手可以各自在独立的工作树中修改代码,避免互相覆盖冲突,完成后再通过merge合并。理解了这个背景,你就能明白为什么Codex要把「工作树模式」作为多任务并行的推荐环境。
内置终端的妙用
Codex还内置了终端(Command+J打开),工作目录会自动跟随当前对话,且能读取终端输出(如开发服务器日志)自动判断状态。一个实用技巧:如果同时安装了Claude Code,可在Codex终端里输入cloud启动它,实现两个AI协作——Codex做擅长的操作浏览器、生成图片,Claude Code优化前端设计。

操作浏览器与电脑:Codex的突出优势
安装BrowserUse插件后,Codex可自主打开浏览器、访问网站、点击按钮、填表单、截图录屏、抓取信息。实测让它在Canva里找免费模板、修改标题并输出报告的全过程,仅在需登录时才需人工介入。
这背后依赖的是一项名为Computer Use的前沿技术,它代表了AI Agent领域的一个重要方向——GUI Agent(图形界面智能体)。传统的AI工具调用依赖API接口,而Computer Use则通过截取屏幕画面、理解界面元素位置,然后模拟鼠标点击和键盘输入来操作应用程序。这项技术最早由Anthropic在2024年10月发布的Claude Computer Use中引起广泛关注。其技术原理涉及视觉定位模型(将屏幕截图中的按钮、输入框等元素转化为坐标)、OCR识别、动作规划等多个AI子系统的协同工作。它的革命性在于打破了API壁垒——即使软件没有提供编程接口,AI也能像人类一样通过界面操作来完成任务。
更进一步,Codex还能操作电脑上的其他应用(目前仅支持Mac)。实测中它自主打开Chrome、访问小红书、搜索关键词、下载无水印图文笔记并保存到桌面文件夹,全程无需插手,质量很高。
AGENTS.md:给AI写一份入职手册
在项目根目录创建AGENTS.md文件,Codex每次启动会自动读取并遵守其中规则。这解决了「每开新对话就要重复注意事项」的痛点,就像给新同事写入职手册。
AGENTS.md的设计理念体现了提示工程(Prompt Engineering)从一次性提示向系统化规则演进的趋势。在AI Agent场景中,单次对话的提示词往往不够用——你需要定义全局行为准则、代码风格、禁止操作等持久性规则。AGENTS.md本质上是一种「系统提示词的文件化」,类似于软件工程中的.editorconfig或.eslintrc配置文件,但面向的对象是AI而非代码编辑器。业界目前已有多种类似实践:Cursor使用.cursorrules文件,Claude Code使用CLAUDE.md文件,GitHub Copilot也开始支持自定义指令文件。这些文件的共同设计原则是简洁、具体、可执行——模糊的规则AI难以遵守,过长的规则会挤占有效上下文空间。
用中文写清规则即可,但需注意控制在150行以内,否则会占用AI记忆容量,反而影响对具体需求的理解。
实战案例:从零做一个网站并部署上线
通过一个完整流程来串联所有功能。新建「个人品牌网站」项目后输入需求,Codex自动写代码、本地启动开发服务器并给出预览网址。不满意的地方可实时对话修改(如「给标题加上编剧」),刷新即见效果。

最后是部署上线。安装Vercel插件并授权后,直接@选择Vercel插件让它部署,片刻即得到公开网址,全世界都能访问。Vercel是由Next.js框架创始人Guillermo Rauch创办的云端部署平台,专注于前端应用和Serverless函数的托管。它的核心优势在于零配置部署——只需关联代码仓库,Vercel会自动检测项目框架、执行构建、分配CDN域名并完成上线,整个过程通常不到一分钟。Vercel背后使用了边缘计算网络(Edge Network),将内容部署到全球数十个节点,用户访问时自动路由到最近的服务器。这解释了为什么整个过程如此快速——平台已将传统需要运维工程师完成的服务器配置、域名解析、SSL证书申请、CDN分发等工作全部自动化。整个过程无需手动写一行部署脚本。
六条实用心得与常见问题
以下六条经验能帮你更高效地使用Codex:
- 涉及文件就用项目,不用对话;
- 一个任务一个对话,对话越纯AI表现越好;
- 复杂任务先出计划(用计划模式),确认无误再实施;
- 写清「完成标准」,比如「做完的标准是测试全过、手动测能用、没改无关文件」;
- 经常提交,方便改坏时快速回退;
- 让Codex审查自己的代码,新开对话检查安全性和性能,常能挑出遗漏问题。
常见问题应对
- 额度用尽:等1-2小时刷新即可恢复;
- 改坏了代码:工作树模式直接扔副本、本地模式则点全部撤销或
git checkout; - AI改了无关代码:在AGENTS.md里明确写「没有我的要求不要做额外优化」。
结语:无论是否程序员都值得学
Codex已从纯编程工具进化为全能AI助手。运营人员可设自动化每天出报告,摄影师可快速做交互原型验证想法,自媒体博主可让它搜索整理爆款选题——你无需懂HTML、CSS、JavaScript,只要用中文说清需求即可。
但也需要明白,Codex能发挥多大威力,核心取决于使用者:你越懂自己的项目、越能清晰描述需求,它就越能高质量完成任务。含糊的需求只会得到含糊的结果。这或许是所有AI Agent工具的共同真理。
核心要点
相关推荐

前Meta员工爆料:高薪工程师竟在给AI做数据标注
前Meta员工曝光大厂AI化转型真相:百万年薪工程师被安排做RLHF数据标注,组织扁平化后员工只需向AI系统汇报,咨询医疗等行业也在被AI重塑。知识工作者如何应对自我替代的职业困境?

自然语言驱动Blender:用AI编程助手生成3D场景实战
通过ChatGPT Codex等AI编程助手调用Blender Python API,仅用几句自然语言指令即可生成精美3D场景。本文详解从安装到渲染的完整流程,探讨编程助手作为通用执行器的创作新范式。

CAPI-DINO:为自监督学习补上全局表征的组合式探索
CAPI-DINO实验将DINO全局目标叠加到CAPI局部表征之上,在ViT-B/14模型上实现68.7%线性探测准确率,仅消耗16%算力。本文详解其架构设计、实验结果及局部与全局表征的权衡。