[控场AI]
· 4 分钟阅读· 2,484 字

OpenAI一周复刻竞品:Computer Use能力被低估了吗?

OpenAI一周复刻竞品:Computer Use能力被低估了吗?

OpenAI一周复刻竞品功能,揭示Computer Use路线之争与平台化壁垒的行业深层逻辑。

OpenAI在DevDay期间展示了其惊人的产品迭代速度——一周内交付对标竞品的Computer Use功能,背后是多模态模型与Agent框架成熟后的复利效应。围绕这一事件,文章深入探讨了Computer Use(让AI直接操作图形界面)与API调用之间的路线之争:反对者认为GUI操作效率低下,支持者则指出现实世界中大量系统没有开放API,Computer Use是覆盖自动化长尾场景的必要补足而非替代。对创业公司而言,模型厂商的快速追赶意味着单点功能护城河正在迅速蒸发,真正的壁垒在于平台化生态——将能力沉淀为开发者可复用的原语,才能形成持久竞争优势。这场效率与覆盖广度的路线争论,将深刻影响未来AI Agent的产品形态与行业格局。

从DevDay看OpenAI的执行力

在OpenAI的DevDay系列报道中,一场围绕Computer Use Agent(CUA)团队与API平台负责人的对话揭示了这家公司在产品迭代上的惊人速度。其中最引人注目的,是OpenAI在一周内就交付了一款对标竞品的功能——这一速度本身就值得整个行业思考:当基础模型能力足够强大时,产品层的复制与追赶窗口正在被极度压缩。

这场讨论的核心并不只是速度炫技,而是围绕一个更深层的争论展开:Computer Use(让AI直接操作计算机界面)究竟是不是一条被高估、还是被低估的技术路线。

Dwarkesh 的观点为何值得商榷

播客标题直指对知名科技访谈主持人 Dwarkesh 关于 Computer Use 判断的反驳。Dwarkesh 在其影响力颇广的讨论中,对 Computer Use 这条路线持相对保守甚至怀疑的态度——认为让模型像人类一样点击、滚动、操作GUI,是一种效率低下、绕远路的做法。

而 OpenAI CUA 团队的负责人给出了不同的看法。他们的核心论点在于:世界上绝大多数软件与服务并没有提供干净的 API 接口,真正的长尾场景恰恰需要 AI 具备像人一样使用图形界面的能力。如果只依赖 API 调用,AI Agent 能触及的世界会非常有限。Computer Use 不是对 API 路线的替代,而是对那些无法被 API 覆盖的巨大空白区域的补足。

GUI 操作 vs API 调用的现实取舍

这里存在一个被反对者忽视的现实:API 是理想世界,GUI 是现实世界。企业内部系统、遗留软件、没有开放接口的第三方平台,构成了自动化难以触及的广阔地带。Computer Use 的价值恰恰在于它不挑食——只要有屏幕和鼠标键盘,理论上就能操作。

效率质疑固然成立,但技术路线的判断不能只看当下的执行成本。随着模型推理能力与视觉理解的提升,GUI 操作的成本会持续下降,而它能覆盖的场景广度则是 API 路线难以企及的。

从技术实现层面看,GUI操作与API调用的差异不仅是路径问题,更是控制粒度的根本差异。API调用是结构化的、可预测的——开发者知道输入输出的格式,错误处理有明确的状态码。而GUI操作本质上是在处理像素流:模型需要通过截图识别界面元素,推断当前状态,再决定下一步操作,整个过程更接近人类的感知-决策-执行循环。这也是Computer Use对视觉理解能力要求极高的原因——模型不仅要识别按钮在哪里,还要理解当前界面意味着什么业务状态。目前主流的Computer Use实现(包括Anthropic的Claude Computer Use和OpenAI的CUA)普遍采用截图+动作序列的方式,延迟和token消耗都显著高于API调用,这也是效率质疑的直接来源。但值得注意的是,这一成本结构会随着专用视觉模型的优化和推理提速而持续改善。

Dwarkesh Patel是硅谷科技圈颇具影响力的播客主持人,以深度访谈AI研究者和创始人著称,其节目《Dwarkesh Podcast》的受众主要是技术从业者和投资人。他的观点通常基于与一线研究者的深度交流,因而在AI圈具有相当的传播力和议题设置能力。正因如此,OpenAI CUA团队选择公开回应他对Computer Use的质疑,本身就具有一定的舆论博弈意味——这不只是技术路线讨论,也是在争夺开发者对某条技术路径的信心与资源投入预期。在AI发展日新月异的当下,顶级从业者的公开判断往往会影响资本流向和人才聚集,路线之争因此具有超出技术本身的战略价值。

一周交付竞品说明了什么

OpenAI 在一周内交付对标竞品功能的能力,背后反映的是基础设施与模型能力的复利效应。当底层的多模态模型、Agent 框架、API 平台都已成熟,产品层的功能组装可以被极大加速。

这对创业公司而言是一个严峻信号:单纯依靠某个功能点建立的护城河正在迅速蒸发。如果你的核心竞争力是「基于大模型封装了某种 Agent 能力」,那么模型厂商随时可能在一周内推出同类功能并整合进自己的平台。

平台化能力才是真正壁垒

从 API 平台负责人的视角看,OpenAI 的战略重心并非单点功能,而是把 Computer Use、Agent、工具调用等能力沉淀为开发者可复用的平台原语。这意味着竞争的维度从「谁的功能更好」转向「谁的平台生态更完整、更容易被开发者构建」。

「平台原语」(Platform Primitives)这一概念在AI基础设施领域正变得越来越重要。原语指的是平台提供的最基础、可组合的能力单元——就像乐高积木的标准接口,开发者可以将其自由拼装。OpenAI将Computer Use、函数调用(Function Calling)、代码解释器(Code Interpreter)等能力抽象为API级别的原语,意味着这些能力不再只是产品功能,而是成为生态系统的基础设施。历史上,Stripe把支付原语化、Twilio把通信原语化,都形成了难以被单点产品竞争撼动的护城河。AI领域正在经历类似的基础设施化进程,谁率先定义原语的接口标准,谁就在开发者心智和生态集成上占据先发优势,这种优势的粘性远高于某个具体功能的领先。

对开发者与行业的启示

对于构建 AI 应用的团队,这场讨论传递了几个清晰的信号。第一,不要与基础模型厂商在通用能力上正面竞争,而应聚焦于特定垂直场景的深度整合与数据积累。第二,Computer Use 作为一条能力补足路线值得关注,尤其是那些 API 无法覆盖的自动化需求。第三,迭代速度已经成为核心竞争力——模型厂商的一周,可能就是创业公司数月的工作量。

Dwarkesh 与 OpenAI 团队之间的分歧,本质上是对「AI 该如何与真实世界交互」的路线之争。短期看,效率论者有理;长期看,覆盖广度可能更重要。而这场辩论的结果,将深刻影响未来 AI Agent 的产品形态。

分享:

相关推荐