[控场AI]
· 9 分钟阅读· 4,907 字

OpenAI Dev Day 全盘点:20+ 发布背后的三大趋势

OpenAI Dev Day 全盘点:20+ 发布背后的三大趋势

OpenAI Dev Day 密集发布20余项产品,以持久化智能体、高效模型和协作工作区三条主线强化AI工具生态。

OpenAI Dev Day 一次性推出超过20项发布,核心产品包括:由GPT-6 Astra驱动的持久化个人智能体DOTS(仅限专业用户)、以五分之一价格逼近Astra性能的GPT-6.1 Sol、面向快速分类场景的Decisions API,以及被普遍好评的AI协作工作区Space。此外,ChatGPT平台化、Sign in with ChatGPT和模型市场等「小发布」被认为对OpenAI护城河意义深远。旗舰模型Astra下一版本因安全顾虑被搁置,折射出前沿模型在主动性与安全边界之间的深层张力。整场发布会确认了三条主线趋势:模型足够好且足够便宜、智能体走向持久常驻、AI原生支持多人协作。

OpenAI 在 Dev Day 一次性抛出了超过 20 项发布与公告。据 AI Daily Brief 的分析,OpenAI 团队内部坦言,最新一代模型(如 Astra)大幅加速了研发节奏,许多原本预计要到更晚才能落地的能力,已经提前成为这次 Dev Day 的内容。

这场发布会没有颠覆行业的既有走向,反而强化了过去一年逐渐成形的几条主线:模型变得更便宜、更高效;AI 从被动调用走向持久常驻的工作形态;而这种持久工作正从单人体验扩展为多人协作。下面逐一拆解这次发布的重点。

DOTS:OpenAI 的个人智能体答卷

Sam Altman 将 DOTS 描述为「极其强大,几乎你能想到的任何事都能做」。用户可以创建一个持久化的智能体,通过类似短信的界面与它交流,让它在自己的云端电脑上处理任务,支持多达 4 万个应用,还能通过语音通话、Microsoft Teams 和 Slack 进行沟通,并在不同服务与会话间保留上下文。

它与 Muse 在形态上高度相似,连可爱的吉祥物都如出一辙。但有几点关键差异:现阶段用户一次只能创建一个 DOT(未来将扩展为智能体团队);更重要的是,OpenAI 只向 Pro、Business 和 Enterprise 客户开放 DOTS,而 Muse 的成功很大程度上来自完全免费。CFO Sarah Fryer 表示愿景是让 DOTS 覆盖全体消费者,但目前它仍是一款面向专业用户的产品。最大的卖点在于——DOTS 由 GPT-6 Astra 驱动,这是首次有真正的前沿模型来操控第一方个人智能体。

DOTS 上手后用户遇到的各种初期问题

实际体验褒贬不一。Chase Browser 遇到了 DOT 丢失全部工作的情况;分析师 Max Weinbach 的测试则显示 DOTS 能自主完成报销处理,表现优于 Grokbot。Justin Schroeder 认为 DOTS 比 Grokbot 或 Muse 更偏向工作场景,「更像是 Codex 编排器和 Slack 协作者,而不是个人助理」,并在 Slack 中表现最亮眼。Nate B. Jones 则提醒要区分「形态」与「效用」——形态在收敛,但各家智能体擅长的具体任务并不相同。

「持久化智能体」(persistent agent)与传统对话式 AI 的核心区别在于状态保留:普通 ChatGPT 每次对话结束即清空上下文,而持久化智能体能跨会话记忆用户偏好、历史任务进度和授权凭证。这使智能体从「被动问答工具」进化为「长期驻留的数字员工」——它可以在后台自主轮询邮件、定时提交报告,而无需用户每次手动唤起。这种形态在技术上依赖两个基础设施:一是云端沙箱计算(让智能体操控浏览器和应用而不影响本机环境),二是持久化记忆与权限管理系统(确保跨会话的授权不被滥用)。目前各家厂商对持久化智能体的安全边界划定方式不同,这也是 OpenAI 搁置更高级版本 Astra 的核心原因之一。

Decisions API 与 Space:补齐生态的两块拼图

Decisions API 是 OpenAI 对 Jev 这类「判断模型」的回应。Jev 不擅长输出文本,而擅长分类、给出 0 到 1 的置信度评分——也就是做判断,这正是「决策」的前提。Decisions API 让用户调用一个模仿 Jev 快速分类能力的 Luna 版本:定义问题与候选答案,模型快速给出回应,官方宣称决策速度比 Responses API 快 10 倍。相比 Jev,它的差异化在于支持视觉输入,省去了底层的文本转换步骤,从而扩展了应用场景。目前该 API 仅向有限群体预览开放。

OpenAI Space 类似 AI 增强版的 Google Drive

Space 是一个共享文档工作区,可以理解为 AI 增强版的 Google Drive:团队可协作处理表格、幻灯片等文档,也能托管工作流自动化任务,DOTS 能原生地在 Space 文档上工作。与 DOTS 的争议不同,Space 几乎一边倒地获得重度用户好评。HowIAI 的 Claire Vo 直言「DOTS 略被高估,Space 则被低估,我认识的每家公司都想要一个 AI 原生的协作工作区」。Every 的 Dan Schipper 指出,原生文档避免了智能体通过浏览器操作 Google Docs 时那种「字一个个慢慢爬出来」的延迟,协作体验更流畅。

「判断模型」(classifier/decision model)是区别于生成模型的另一类 AI 架构。生成模型(如 GPT 系列)的核心任务是逐 token 输出连贯文本,而判断模型专为快速分类和置信度评分优化——它不生成解释,只输出「是/否」或 0 到 1 的概率值。这类模型在内容审核、风险评估、实时路由等高频低延迟场景中具有天然优势。Jev(xAI 旗下)率先将这种能力包装成独立产品;Decisions API 是 OpenAI 的跟进之作,差异化在于加入视觉输入支持,让图像内容也可以直接参与判断流程,省去先用 OCR 或多模态模型提取文字再输入分类器的中间步骤。10 倍速度提升的来源正是这种架构上的专项优化,而非单纯堆算力。

GPT-6.1 Sol 与被搁置的 Astra

当天最重要的模型发布是 GPT-6.1 Sol,OpenAI 的定位是「以五分之一的价格提供接近 Astra 的智能」。它在上周刚发布的 GPT-6 Sol 基础上做出显著升级:编码基准测试全面提升,6.1 Sol 在中等设置下已能超越 6 Sol 的最高设置。在 DeepSwee 上最高得分 75.2%(high 设置),但在 extra high 和 max 设置下反而出现性能退化——这与此前 Opus 5 身上观察到的现象一致,最高努力档位开始让模型「想太多」而推翻正确答案。

在测试长程计算机使用的 OS World 上,6.1 Sol 最高得分 71.4%,超过 6 Sol 的 64.4%,接近 Astra 的 73.5%,而且提升努力档位几乎不增加成本,意味着 OpenAI 在计算机使用的效率上取得了突破。Artificial Analysis 给出 52 分,仅比 Astra 低一分,但成本效率惊人——基准测试运行成本只有 Astra 的四分之一,比 6 Sol 还便宜 31%。OpenAI 称其为「当前性能对应成本最具效率的模型」。

OpenAI 因安全顾虑搁置了旗舰模型的下一版本

不过,我们可能很久都见不到 GPT-6.1 Astra。《华尔街日报》报道称,OpenAI 因安全顾虑搁置了旗舰模型下一版本的发布计划。安全系统负责人 Sachi Jain 表示,模型虽然比前代「更不偷懒」,但「在保持在授权范围内、以及如何向用户回报已完成工作的类型方面,还没达到标准」。换言之,要迈向下一代前沿,OpenAI 可能需要先攻克一些技术难关,才能达到他们认为足够安全的发布门槛。

文中提到的「努力档位」(effort level)是新一代推理模型的重要调参维度:模型在生成答案前会进行内部「思考」(chain-of-thought reasoning),档位越高,思考步骤越多,理论上越准确,但延迟和成本也随之上升。然而 GPT-6.1 Sol 在 extra high/max 档位出现性能退化,揭示了一个反直觉的现象——过度推理会导致模型推翻原本正确的答案,业界称之为「overthinking」或「reasoning collapse」。Anthropic 的 Opus 5 也观察到类似规律。这表明当前推理模型的训练对「何时停止思考」的校准还不够精准,是业界共同面对的开放性问题,也意味着单纯提高算力投入并不能线性提升输出质量。OS World 是一个衡量 AI 操控真实操作系统能力的标准化基准,任务涵盖文件管理、网页交互和多步骤应用操作,得分越高代表在真实计算机环境中的自主完成能力越强。

被低估的「小」发布:生态与护城河

除了头条产品,还有一批被认为「静悄悄却意义重大」的发布。

ChatGPT 平台化:开放给外部开发者,让 ChatGPT 有望成为类似应用商店的平台。但也有质疑声,MIT 的 Christian Catalini 发问——开发者带来应用、OpenAI 带来智能,那用户的行为数据归谁?「如果你的贡献是教会合作伙伴怎么做你的工作,这是一桩耐人寻味的合作。」

Sign in with ChatGPT:允许用户用 ChatGPT 账号登录其他应用,把智能订阅「随身携带」。Jackie Luo 认为这远不止是认证功能,而是 OpenAI 把优惠定价扩展给第三方、将服务打包进订阅,让用户不再为 token 和应用重复付费,应用也能只对应用层收费。

OpenAI 新推出 500 美元订阅档,用量是 Plus 的 25 倍

订阅与算力:UltraFast Mode 让 Codex 的 token 生成速度提升 8 倍、应用内提升 6 倍;新增 500 美元订阅档,用量是 Plus 的 25 倍。同时重新开放的 200 美元 Pro 档虽回归,但用量计算调整后相当于 API 成本减半——这引发了「同样模型价值缩水」的不满。背后的现实是:算力约束真实、持续且短期无解,前沿模型正撞上现有算力的天花板,由此倒逼出的效率优化,长期看会带来更具性价比的体验,但过程中难免颠簸。

模型市场:允许用户通过 OpenAI 的 Responses API 在 Codex 中购买来自 Base10 的开源权重模型推理。这对 OpenAI 的护城河意义重大——既抵御开源的冲击、给客户更多选择,也让企业能安心做出大额支出承诺,因为这些预算可以用于包含开源权重模型的多模型策略。

「Sign in with ChatGPT」在技术架构上类似 OAuth 协议(即「用 Google/Apple 账号登录」的底层标准),但其商业逻辑更激进:它不只传递身份认证信息,还将用户的 OpenAI 订阅权益(包括模型访问等级和用量配额)携带进第三方应用。对开发者而言,这意味着无需自建 AI 基础设施,只需对接 OpenAI 的接口即可向用户提供智能功能,开发成本大幅降低。对 OpenAI 而言,这是一种「平台税」逻辑的变体——不直接抽佣,而是让整个生态依赖其账号体系和订阅收入,从而在应用层建立类似 Apple ID 的黏性。这也是 Christian Catalini 质疑的根源:数据与用户关系的归属权,在这一模式下存在结构性的不对等。

三条趋势,清晰可见

把这 20 多项发布串起来,Dev Day 揭示的并非全新方向,而是对过去一年几条主线的确认与深化:

其一,GPT-6.1 Sol 和 Decisions API 延续了「足够好且足够便宜,以至于可以无处不用」的模型趋势——你不必关掉它,也不必纠结该用在哪里。

其二,DOTS 代表持久化、主动化的智能体,真正把「无处不用」落到实处;而平台插件扩展和 Sign in with ChatGPT 则意味着「无处不用」既是走出去,也是把一切接进来。

其三,Space 进一步确认下一代 AI 不只是单人模式,而会原生地支持团队与多人协作模式,尽管目前仍处于早期。

这些趋势,才是真正会重塑我们未来几个月使用 AI 方式的力量。

分享:

相关推荐