[控场AI]
· 8 分钟阅读· 4,379 字

Codex提示词被公开后,智能体的护城河还剩什么?

Codex提示词被公开后,智能体的护城河还剩什么?

OpenAI智能体7100行系统提示词遭泄露,让行业看清规则、工具与模型如何协同,也让估值逻辑变得更易拆解。

GitHub上一份7100行的系统提示词归档,让外界得以直接研究OpenAI智能体产品的行为规则——任务如何持续推进、工具如何调用、何时请求用户许可。文章围绕这次泄露,逐层剖析智能体的工程构成:系统提示词定义行为规范,工具让模型接触真实环境,Harness运行框架负责将模型输出、环境反馈与任务状态串联成可靠的执行循环。单步95%成功率在20步连乘后仅剩约35.8%,揭示长任务链条的内在脆弱性,也说明补救与回退机制的工程价值。与此同时,文章结合OpenAI的融资规模、模型定价分层和竞争格局,指出工程流程公开后,产品之间的比较将更直接落在任务完成率、可靠性和总体成本上,而非仅凭品牌或功能列表。

一个能改代码、调用工具、操作电脑、还能持续推进任务的智能体,究竟值多少钱?这个看似抽象的问题,正因为一批系统提示词的公开被重新摆上桌面。据B站UP主娜娜的分析,OpenAI在DevDay发布GPT-6 OneSoul的同时,GitHub上的System Prompts Leaks仓库收录了标注为Codex的提示词文件,其中GPT-6 OneSoul的归档文件多达7100行,详细规定了智能体如何推进任务、调用工具,以及何时向用户请求许可。

这件事发生在一个敏感的商业节点。相关融资披露显示,OpenAI正以约1.4万亿美元估值寻求超过300亿美元的新融资,上市时间推迟至2027年。当一家公司的价值越来越依赖智能体替人完成工作,支撑这套产品的工程流程一旦公开,就会引出一个现实问题:客户付的钱,有多少是为模型能力,有多少是为围绕模型搭建的工作系统?

7100行规则里藏着什么

按照披露描述,研究人员通过反复追问和诱导,让模型输出自身的行为规则,再由仓库整理归档。公开的核心是模型接收到的指令和工具协议。

这些规则相当具体。比如用户要求完成一个任务,模型应持续推进到结果可交付;需要部署变更时,先把能完成、能复合的工作做完,再把审批留到最后;面对可逆操作和只读动作,不必反复向用户请示。连中间进度如何汇报、回复如何排版,都有明确约定。

把这些规则放回日常工作就很好理解。你请一个助手改程序,期待的不止是改几行代码,而是他读懂项目、找到相关文件、完成修改、检查结果、遇到问题继续处理,最后交给你一个可以评审的版本。模型负责理解和生成,工具让它真正接触文件与运行环境,规则则告诉它如何把这些动作串成完整工作。三者接在一起,才有了我们看到的智能体体验。

最有价值的变化,是开发者能直接研究这套写法。原来只能从产品表现推测的东西——怎样减少无意义的确认、怎样约束权限、怎样让任务持续推进、怎样交付可检查的结果——现在可以逐条查看。对竞争对手而言,这相当于拿到了一份具体的工程参考,会缩短摸索流程的时间,也让一些产品体验更容易被模仿。

系统提示词(System Prompt)是在用户对话开始之前注入给模型的隐藏指令,用于设定模型的角色、权限边界、输出格式和行为优先级。它不出现在用户界面上,却决定了模型在整个会话中的"个性"与决策逻辑。对于智能体产品而言,系统提示词相当于操作手册:它告诉模型什么情况下可以自行推进、什么情况下必须请示用户、遇到错误时如何处理。7100行的体量意味着这份手册覆盖了极为细粒度的场景分支,包括权限分级、工具调用顺序、任务中断与恢复逻辑等。正因如此,这类提示词历来被视为商业机密——它凝缩的不只是prompt写作技巧,更是大量实际任务测试后沉淀下来的工程经验。

为什么规则不等于可靠完成

把规则交给模型,距离可靠完成任务还有一段路。长任务里最容易被忽略的问题是:单个步骤表现不错,整段工作仍可能失败。

娜娜举了一个概率示意:假设任务需要连续完成20个步骤,每步成功率都是95%,且可按相同条件连乘,最终全部成功的概率约为35.8%。听起来每一步都挺可靠,串起来却只剩大约三分之一。原因在于前面的结果会成为后面的输入,一次没处理好的错误,就可能让后续工作沿着错误方向继续。

这个计算揭示的是任务链条的脆弱性。实际智能体还可以检查、重试和回退,而这些补救动作正是工程系统需要解决的部分:修改文件后运行检查,看到错误再调整;调用工具后读取返回结果,确认操作是否成功;任务要保留状态,避免把已完成的步骤忘掉。模型每次生成的内容,要经过环境反馈才能成为下一步的依据。

这套把模型、工具、状态和反馈连接起来的系统,通常被称为Harness,也就是智能体的运行框架。

这套把模型、工具、状态和反馈连接起来的系统,通常被称为Harness,也就是智能体的运行框架。可以把它理解为工作台:每次行动留下结果,系统再根据结果决定如何继续。系统提示词是工作台上的操作规程,规程写得清楚能减少混乱,但工具是否有效、模型能否理解反馈、出问题能否恢复,同样影响最终交付。

100行代码也能跑的精简框架

SWE Bench团队用约100行Python构建了一个名为Mini-SWE Agent的精简框架,并报告在SWE Bench Verified上约65%的解决率。这个例子值得关注,因为它把工作循环压到极小:模型提出动作,环境执行,结果返回,模型继续处理。

工程设计不一定要靠复杂的模块数量来证明价值,关键在于这个循环能否帮助模型解决问题。需要留意的是,约65%的解决率属于特定模型、运行设置和评测任务下的结果,判断框架效果要把这些条件一起看。框架的代码行数容易比较,实际任务能否完成,才是客户最终感受到的差别。

这也把问题推向了开源模型。开发者可以把公开的规划规则、自主推进要求和工具协议,接到DeepSeek广告、Qwen等模型上,再检查长任务表现是否改善。流程更容易借鉴之后,竞争会更直接地落到交付效果上。

SWE Bench(Software Engineering Benchmark)是由普林斯顿大学团队发布的软件工程评测基准,要求模型根据GitHub Issue描述,在真实代码仓库中自主定位并修复对应的Bug,最终以能否通过测试用例作为验收标准。SWE Bench Verified是其子集,经人工核验确保任务描述清晰、可复现,通常被认为比完整版更适合作为横向比较的基准。65%的解决率意味着模型在这个子集中能独立完成约三分之二的真实代码修复任务,这在需要跨文件理解、多步推理和环境交互的编程任务上是相当有参考价值的数字。不过,不同团队提交结果时所用的模型版本、推理预算和重试次数不尽相同,比较时需要留意这些实验条件的差异。

一个任务到底该花多少钱

对企业客户来说,最关心的往往是一个完整任务需要花多少钱。一次调用便宜,如果需要多次返工,成本也会累积;一次调用贵,如果能稳定完成工作,也可能节省人工。把模型价格和最终产出连起来,智能体的商业价值才算得清楚。

OpenAI自己也在区分成本档位:GPT-6 Astra每百万Token输入10美元、输出50美元;GPT-6 OneSoul则是输入2美元、输出10美元,缓存输入0.10美元。OneSoul的普通输入输出单价约为Astra的五分之一。在OpenAI的DeepSWE V1评测口径下,OneSoul被描述为以约五分之一的成本逼近Astra。这种产品定位本身就在回答客户的成本问题:哪些任务需要旗舰,哪些任务可以用更经济的模型完成。

但替代方案的账也要算完整。

娜娜算了一笔账:假设一家企业为500名工程师,每人购买每月500美元的订阅,按12个月计算,一年订阅费用就是300万美元。面对这样的支出,企业自然会比较其他方案。但替代方案的账也要算完整——本地部署需要服务器,也需要维护模型运行环境、工具权限、任务状态和故障处理。既然智能体的执行力来自多个部分协同,购买硬件之后,这些部分同样需要有人接好。企业真正要比较的是:一年投入多少,能可靠完成多少工作,还需要多少人工接手。

这为什么牵动估值

高估值依赖未来收入,也依赖企业能长期保留多少利润。围绕OpenAI的融资披露,接近700亿美元的年化经常性收入被列为未来目标,而Sol和常驻智能体Dots被寄望于扩大企业业务。Dots配备云端虚拟机与浏览器,能够持续执行任务。如果客户长期使用,订阅收入就有机会持续增长。

可一旦客户发现部分工作能换种方式完成,服务商就需要用更具体的交付效果证明价格为何值得。工程流程公开给这个比较增加了新入口:原先竞争者需要自己摸索的行为设计,现在可以直接研究。它可能削弱流程设计带来的独占优势,也会提高客户比较不同方案的意愿。

如此庞大的资金需求

话说回来,OpenAI还要面对庞大的资金需求。据《金融时报》报道,OpenAI预计在2026至2030财年间累计消耗约2780亿美元现金。这意味着公司既要持续融资,也要让收入增长逐步支撑这些投入。如果替代方案增多、价格受到压力,公司就更需要证明服务能持续提供客户愿意付费的价值。此外据相关报道,美国联邦贸易委员会于9月30日对OpenAI、Anthropic等公司展开调查,关注其AI技术可能给消费者带来的风险。

年化经常性收入(ARR,Annualized Recurring Revenue)是SaaS和订阅制企业常用的收入衡量指标,指将当前订阅合同金额折算为一年口径的数字,用于反映业务规模的当前快照而非历史累计。投资人在给高成长科技公司估值时,通常会以ARR的倍数作为锚点:如果一家公司ARR为X,市场给出的估值往往是数十倍的X,其余部分则对应对未来增长的预期。OpenAI约1.4万亿美元的估值与700亿美元的ARR目标并置,意味着市场对其隐含了约20倍左右的收入倍数预期,这在传统软件行业属于极高水平,背后是对智能体规模化落地能持续带来订阅增长的押注。一旦竞争加剧、客户流失或价格承压,这一倍数就面临重新定价的压力。

竞争最终回到产品本身

智能体未来可能沿两条技术路线发展:一条是把更多任务规划和工具决策能力训练进模型本身,减少对外部文字规则的依赖;另一条是让模型与专用芯片协同设计,在相同工作量下更有效率地使用算力。

希望在相同工作量下更有效率的使用算力

这两个方向能否形成持续优势,最终都要接受任务表现和成本的检验。这次提示词公开最值得关注的影响,是它让智能体的价值变得更容易拆开讨论:规则、模型、工具环境各自承担什么作用看得更清楚,哪些设计可借鉴、哪些能力还需投入也更容易比较。

对闭源产品来说,这提高了证明价值的要求;对开源开发者来说,这提供了改进工作流程的参考;对客户来说,则意味着可以把选择建立在更具体的指标上——任务是否完成、结果是否可靠、整体成本是否合适。

回到开头的问题:一个智能体究竟值多少钱,答案要落在它能交付多少工作上。7100行规则让我们理解它怎样行动,而长期的商业价值需要由持续的执行结果来支撑。提示词公开之后,产品之间的比较会更加具体。谁能把可借鉴的流程变成可靠、经济、可持续的服务,谁才更有机会留住客户,也留住自己的溢价。

分享:

相关推荐