前Anthropic工程师实测:为何弃用Claude Code转投Codex

核心观点:Codex正在吞噬一切软件
Pietro,MagicPath创始人、前Anthropic工程师,在David Ondrej的播客中分享了一个令人震惊的观点:他已经五个月没碰Claude Code了。作为一个曾在Anthropic内部参与过Claude Code和MCP(Model Context Protocol,Anthropic推出的标准化AI与外部工具通信的开放协议)开发的人,这个转变意义重大。
Pietro认为,Codex之所以优于Claude Code,有两个核心原因:第一,Codex构建了更好的智能体循环(agentic loop),而Claude Code过于臃肿;第二,Codex的token消耗效率远优于Claude Code。
所谓智能体循环,是指AI Agent执行任务时的核心运行机制:接收指令→分析任务→制定计划→执行操作→观察结果→调整策略→继续执行,形成持续迭代的闭环。一个高效的agentic loop需要在每个循环步骤中最小化不必要的计算开销,同时保持足够的上下文理解能力。Claude Code被批评为"臃肿",可能是因为其在每个循环步骤中加载了过多的系统提示和安全检查,导致token消耗增加。而Codex的设计哲学更倾向于精简循环,让模型专注于任务本身。
在深度SWE基准测试中,Codex完成相同任务使用的token更少,速度更快,成本更低。SWE-bench是由普林斯顿大学研究团队创建的软件工程基准测试,它从真实的GitHub仓库中提取bug修复任务,要求AI系统理解代码库、定位问题并生成正确的补丁。在这个基准上,token效率直接关系到实际使用成本和速度,因为每个token都意味着API调用费用和等待时间。Codex在这一指标上的领先,意味着开发者在日常使用中能显著降低成本。
这不仅仅是工具偏好的问题,而是反映了一个更深层的趋势:未来的工作不再是"做事",而是"监督事情被做"。



AI Agent正在重塑软件行业
传统SaaS模式的终结
Pietro提出了一个大胆的预判:传统的SaaS商业模式正在走向死亡。他的逻辑链条是这样的:
过去,团队中的工程师用VS Code,PM用Google Drive,设计师用Figma——每个角色被绑定在特定工具上。但AI Agent的出现让角色边界开始坍塌:设计师可以写代码,工程师可以做产品决策,PM可以直接实现功能。每个人都在构建自己的工具链和工作流。
在这种环境下,要求所有人使用同一个工具变得不现实。用户已经习惯了运行自己的Agent,他们需要的不是另一个网站,而是能与任何Agent集成的服务。这意味着未来的软件产品形态将从"用户界面驱动"转向"API和协议驱动"——软件的价值不再体现在精美的UI上,而在于它能否被AI Agent无缝调用。
浏览器从主角变配角
Pietro预测OpenAI将推出Codex SDK,让应用程序能够直接与Codex通信。SDK(Software Development Kit)是一套允许开发者将某项服务集成到自己应用中的工具包。如果OpenAI推出Codex SDK,意味着任何应用都可以在后台调用Codex的代码生成和执行能力,而不需要用户打开浏览器访问ChatGPT。这种架构类似于Stripe让任何应用都能处理支付——Codex SDK将让任何应用都能执行编程任务。
他认为ChatGPT Atlas失败的原因在于它是"浏览器优先、Agent其次",而正确的方向应该是"Agent优先、浏览器其次"。这种"Agent优先"的架构意味着AI不再是用户手动访问的网页工具,而是嵌入到各种工作流中的底层服务。
他在播客中做了一个现场演示:用手机上的Codex说"帮我做一个关于David Ondrej的网站",Agent自动搜索信息、创建项目、生成完整网站——所有这些都可以在散步时完成。这就是他所说的未来工作形态:你不需要坐在电脑前打开编辑器,只需要告诉Agent你想要什么。
Pietro的Codex高效工作流详解
键盘文本替换:被低估的生产力武器
Pietro分享了他最核心的效率秘诀——利用macOS的键盘文本替换功能,将常用的复杂提示词压缩为简短的触发词。macOS系统设置中内置了文本替换功能(设置→键盘→文本替换),用户可以设定当输入特定短语时自动展开为完整的长文本。这个功能原本设计用于快速输入邮箱地址或常用短语,但Pietro将其改造为AI提示词的快捷入口:
- "Absorb":触发"深度吸收这段代码,解决所有功能问题"的完整提示
- "Explain":触发"像给初级开发者解释一样说明这个项目,并写出构建计划"的详细指令
- "Spawn":触发多Agent并行工作的提示,让多个Agent同时处理不同任务
- "PR":自动处理分支合并、cherry-pick等Git操作
- "Bug":触发代码审查,查找潜在bug、回归问题和边界情况
其中cherry-pick是Git版本控制中的高级操作,允许开发者从一个分支中选择性地提取特定的提交应用到另一个分支。在多Agent并行工作的场景中,不同Agent可能在不同分支上完成各自的任务,最终需要通过cherry-pick、rebase等操作将成果整合到主分支。这些操作对人类开发者来说容易出错且耗时,但对AI Agent来说是可以完全自动化的流程。
更妙的是,这些文本替换通过iCloud同步到iPhone,所以在手机端使用Codex时同样可用。而且,你甚至可以让Codex自己去你的文本替换设置里添加新的快捷方式。
模型切换策略:高低搭配
Pietro揭示了一个精妙的模型使用策略:用最强的模型(如GPT-5.5 High)来制定计划,然后切换到较弱的模型(Low模式)来执行计划。他的理由很简单:最聪明的模型应该用来思考问题,执行可以交给更便宜的模型。
这种策略背后的经济学逻辑很清晰:高级模型(如o3、GPT-5.5的High推理模式)每次调用的成本可能是低级模式的5-10倍。如果一个复杂任务需要50次循环迭代,全程使用高级模型的成本将非常可观。但实际上,真正需要"深度思考"的只是最初的规划阶段,后续的代码编写和文件操作更多是机械性执行,低级模型完全胜任。
但Codex的plan模式有个限制——选定模型后无法切换。所以Pietro用文本替换的方式绕过了这个限制:先让高级模型以"给初级开发者写计划"的形式输出,然后手动切换到低级模型执行。这种"写给初级开发者"的措辞是刻意的——它迫使高级模型输出足够详细、无歧义的步骤说明,确保较弱的模型也能准确执行。
前端设计的上下文秘诀
很多人抱怨OpenAI模型做前端设计不行,但Pietro认为这纯粹是上下文问题。通过MagicPath提供设计上下文(包括色彩体系、间距规范、组件库参考、设计风格描述等),GPT-5.5生成的界面质量可以媲美Opus。他现场演示的效果确实令人印象深刻——"当人们说AI生成的是垃圾,那是因为他们没有提供正确的上下文。"
这揭示了当前AI编程工具的一个核心洞察:模型能力的上限往往不是由模型本身决定的,而是由输入的上下文质量决定的。一个没有任何设计规范约束的提示词,生成的界面自然是默认的、平庸的;但当你提供了完整的设计系统作为参考,模型就能在这个约束空间内生成高质量的输出。
创业者的实战建议
品牌和社区是唯一的护城河
Pietro认为在AI时代,技术壁垒几乎不存在,唯一重要的是品牌和社区。他自己就是最好的例子:一年半前发推说"Figma已死",被无数人攻击,但事实证明他是对的。这种持续的、有立场的输出帮他建立了强大的个人品牌。
这个判断的底层逻辑是:当AI让任何人都能在几天内复制一个产品的技术实现时,产品的差异化只能来自两个地方——用户对品牌的信任和认同,以及围绕产品形成的社区网络效应。这也解释了为什么越来越多的AI创业者选择"build in public"(公开构建)的策略,在产品完善之前就开始积累受众。
如何做一个爆款Demo
Pietro总结了三条黄金法则:
- 工具:使用Screen Studio录屏,它会自动跟踪鼠标点击并放大,让演示效果更专业。Screen Studio是一款专为macOS设计的屏幕录制工具,售价约89美元,其核心卖点是自动化的后期处理能力:自动跟踪鼠标移动并添加缩放动画、自动裁剪无效区域、添加设备外框等。这使得普通开发者无需学习Final Cut Pro或Premiere就能制作出接近专业水准的产品演示视频。
- 时长:控制在一分钟以内,Twitter上超过60秒观众就会流失。这与平台的算法机制有关——Twitter/X的视频完播率直接影响推荐权重,短视频更容易获得高完播率,从而获得更多曝光。
- 故事:构建一个连贯的使用场景,而不是罗列功能。好的demo应该让观众产生"我也想这样做"的冲动,而不是"这个功能很厉害但跟我无关"的距离感。
他用一个43秒的视频展示MagicPath在Codex中的使用,获得了近50万次观看,直接带动了用户量的飙升。
给零基础创业者的建议
如果今天从零开始创业,Pietro会这样做:
- 尽量少做UI,一切都应该是Agent可调用的API或服务。这意味着你的产品核心价值应该通过程序化接口暴露,而不是锁在一个精美但封闭的界面里。
- 专注于上下文和数据,而不是产品界面。在AI时代,谁拥有高质量的领域数据和上下文,谁就拥有真正的竞争优势。
- 先解决一个问题,不要一开始就做一百个功能——"完美是好的敌人"
- 找20个beta测试者,因为AI领域太火了,免费就能找到大量愿意测试的人。Twitter/X上的AI社区极其活跃,一条带有demo视频的推文就能吸引到足够的早期用户。
- 直接用Codex做demo,录个视频发出去,不要害怕只有三个赞
Pietro自己的经历就是最好的证明:一条推文获得百万浏览,一周内完成融资。当然,这背后是多年的积累和正确的时机,但如果他从不发那条推文,一切都不会发生。
唯一确定的赌注:模型会持续变强
Pietro最后给出了一个朴素但深刻的判断:在AI领域,唯一可以确定的事情就是模型会持续变强。四个月前没人想到Anthropic会在编程Agent领域失去王座,现在所有人都在转向Codex。
这种快速的格局变化在AI领域已经成为常态。2023年初GPT-4独占鳌头,年中Claude 2开始追赶,2024年Claude 3.5 Sonnet在编程领域封王,而2025年OpenAI的Codex又重新夺回了领先地位。每一次领先优势的窗口期都在缩短,这意味着任何基于特定模型优势构建的产品都面临被快速颠覆的风险。
所以,不要试图预测具体的产品形态,而是选择一个你相信AI会擅长的人类体验子集,然后朝着那个方向持续构建。正如他所说:"选择你热爱的事情,做出来,发出去。如果它有趣,人们会注意到的。"
核心要点
相关推荐

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。

匈牙利算法详解:原理、复杂度与工程实现指南
深入解析匈牙利算法(Hungarian Algorithm)的核心原理、O(N³)时间复杂度优势及工程实现方法。涵盖分配问题定义、算法步骤详解、Python/C++实用工具库推荐,以及在多目标跟踪、资源调度等场景中的应用实践。

Hermes Control Deck:用手机远程操控Codex的开源硬件控制台
Hermes Control Deck是一个开源微型控制台项目,支持通过实体按钮和手机远程界面控制Codex编程助手,提供会话恢复、实时状态监控、远程审批等功能,为AI编程交互带来全新体验。