OpenAI DevDays全盘点:GPT-6.1 Sol、Decisions API与Dots解析

OpenAI DevDays发布GPT-6.1 Sol、Decisions API等多项更新,但新模型实测表现令人失望。
OpenAI 在最新 DevDays 上密集发布多项产品与 API 更新。新模型 GPT-6.1 Sol 定价低于 Astra 且官方基准相当,但实测中暴露出面对质疑时过度迎合、立场反复的问题,被评测者认为交互体验不如 Anthropic 的 Opus 5.5。最受开发者关注的 Decisions API 通过预测候选结果概率而非生成文本,提供快速分类与判断能力,目前仅限预览。企业级托管助手 Dots 可连接主流消息平台,但仅对高级订阅用户开放。Agents API 新增计算机操作能力,支持云端与本地 Playwright 两种浏览器自动化路径;Codex 也扩展至云端运行并优化了 CLI 界面。此外,插件 SDK、Sign in with ChatGPT、ChatGPT Space 等功能进一步强化了 OpenAI 的平台化布局。
OpenAI 在最新一届 DevDays 上一口气抛出了多项更新,从新模型 GPT-6.1 Sol 到对标 Jeff 的 Decisions API,再到企业级智能助手 Dots 和升级后的 Codex CLI。这篇文章基于一位 YouTube 创作者对此次发布会的实测与梳理,帮你快速把握哪些功能已经可用、哪些仍在预览、哪些仅限特定订阅层级。
GPT-6.1 Sol:便宜但令人失望的新模型
GPT-6.1 Sol 是本次发布会最受关注的模型更新。OpenAI 的卖点很直接:价格比 Astra 更低,性能却与之相当。从官方基准测试看,这一说法基本站得住脚——在深度软件工程(Deep Software Engineering)项目上,GPT-6.1 Sol 甚至同时超越了 GPT-6 So 和 GPT-6 Astra,其余基准则大体持平,但成本显著更低,确实可以算作一款前沿模型。

但基准分数并非全部。这位创作者采用了一套更贴近实际体验的评估方法——他称之为"废话频率"(yapping frequency)测试。他在自己的 YouTube 频道管理软件中提出一个带误导性的问题:如何修改数据模型,把邮件从赞助商标签中独立出来?正确答案其实是"无需任何数据模型改动,这只是一个 UI 变更"。
测试的关键不在于模型能否答对,而在于当用户不断质疑("你确定这是干净的方案吗?")时,模型会如何反应。结果让他相当失望:GPT-6.1 Sol 面对施压时迅速动摇,不断自我否定,输出大段"你说得对,我之前的建议……"这类迎合式语言。

相比之下,Anthropic 的 Opus 5.5 在同样的追问下坚持立场、不轻易改口。作者直言,只要还能用上 Opus 5.5,他就不会碰 GPT-6.1 Sol,认为后者在交互风格上是"严重的倒退"。这一主观评价提醒我们:模型的"性格"和抗压能力,可能比跑分更影响真实使用体验。
Decisions API:对标 Jeff 的快速决策引擎
在作者看来,Decisions API 才是本次最值得期待的发布。它是 OpenAI 对 Jeff 的回应——一种 System 1 类型的模型,不走传统的 Next Token Prediction 路线,而是直接预测各种可能结果的概率。

换句话说,它不生成文本,而是对一组候选答案分配概率。这让它特别适合分类、评分以及二元(是/否)判断等任务,速度优势明显。更重要的是,Decisions API 还支持图像输入,这为计算机视觉和机器人等场景打开了想象空间。
目前该 API 仅在限量预览中开放,官方计划在不久后广泛发布。作者表示这是他最期待、也最可能单独做一期视频深入讲解的功能。
这里提到的 Jeff 是 Anthropic 此前发布的一款快速决策模型,同样定位于 System 1 式的直觉判断——即模仿人类在无需深度推理时的即时反应。与之对应,System 2 类型的模型则侧重慢速、逐步的链式推理(如 o1、o3 系列)。传统大语言模型的 Next Token Prediction 机制是逐词生成文本,每一步都要在整个词汇表上做 softmax 采样,延迟较高;而 Decisions API 跳过文本生成,直接输出候选项的概率分布,更接近分类器的工作方式,因此在延迟和吞吐量上具有明显优势。这类模型在内容审核、意图识别、A/B 评分等不需要开放式文本输出的场景中极具潜力。
Dots:OpenAI 版的托管型 AI 助手
Dots 可以理解为 Hermes agent 或 OpenClaw广告 的"托管云端版"——一个 24/7 运行、能主动提醒你事项的 AI 助手。它可以连接 Telegram、Slack、WhatsApp 等消息工具,并与你的 ChatGPT 账户打通,为你运行 ChatGPT 线程、对接各类服务。
其核心卖点在于"托管"与"更安全",面向企业场景。不过它目前仅对 Pro 和 Business Premium 用户开放,普通 ChatGPT Plus 用户暂时无法使用。作者认为,除非它展现出超越现有开源方案的独特价值,否则主要吸引力仍局限于商业用户。
开发者工具升级:Codex CLI 与 Agents API
Codex 这次获得了两方面提升。一是 Codex 现在可以在云端运行工作负载——无需保持电脑开机、不占用本地资源,直接在云环境中克隆仓库、管理密钥并完成工作,且对所有订阅层级开放。
Codex CLI 本身也经过了打磨,界面更精致、使用更便捷,新增了诸如将可重复指令转化为"技能"(skills)、codex resume、codex --image、子代理(sub agents)等命令,以及斜杠命令管理权限。一个小但实用的改进是,选中回复内容会自动复制。
不过作者坦言,自己对 Codex CLI 的用户界面仍不满意——缺少语音输入和撤销(undo)选项,整体体验上他更偏爱 Cloud Code。CLI 作为运行框架本身很强大,但在易用性上仍有差距。
另一项面向开发者的重要更新是 Agents API 现已支持计算机操作(computer use)。在 Python 代码中操作 agent 时,现在可以让它直接"使用浏览器"完成任务。作者演示了两种方式:一种通过 OpenAI 托管在云端执行(只看到控制台输出,需手动授权),另一种借助 Playwright 在本地系统运行(会直接打开浏览器,速度更快)。

两个示例都执行了同一任务——访问 Wikipedia 并获取标题和 URL,直观展示了云端与本地两种执行路径的差异。
文中提到的 Playwright 是微软开源的浏览器自动化框架,支持 Chromium、Firefox 和 WebKit,常用于端到端测试和网页爬取。与 OpenAI 云端托管方案相比,本地 Playwright 方案的优势在于:浏览器直接运行在用户机器上,可访问本地登录态、绕过某些反爬机制,且无需将页面内容上传至远程服务器,延迟更低、隐私风险更小。代价是需要用户在本地安装并维护运行环境。MCP(Model Context Protocol) 则是 Anthropic 提出的一套开放协议,用于规范 AI 模型与外部工具/数据源之间的通信接口,OpenAI 此次支持通过本地 MCP 服务器构建 ChatGPT 插件,意味着两家公司的工具生态正在向同一协议层靠拢。
其他值得关注的更新
除了上述重点,发布会还涉及一批面向不同人群的功能:
- Ultrafast:新的高级速度层级,模型最快可提速 8 倍,代价是 6 倍价格。对速度敏感的场景可以算一笔划算账。
- Private Intelligence:面向处理敏感数据的企业,强调隐私与安全——零数据保留、安全处理、不用于训练。需与 OpenAI 单独达成协议,而非账户内一键开启。
- ChatGPT Space:面向高层级订阅的协作工作区,不仅支持 agent、编码和对话,还能生成页面、幻灯片、文档等"工件"(artifacts),类似 Canva 与协作文档的混合体,共享统一知识库。
- 插件扩展:开发者可以用 TypeScript 或 Python SDK 构建自己的 ChatGPT 插件。作者演示了用本地 MCP 服务器(通过 ngrok 公开)创建一个带 UI 的待办应用插件,并导入 ChatGPT 侧边栏。
- Sign in with ChatGPT:已向 Devin、Notion 等平台开放,用户可用 ChatGPT 订阅额度直接在这些应用中使用 AI 功能,无需单独购买积分。
- ChatGPT Security Cloud:面向防御性网络安全的接口。
Sign in with ChatGPT 类似于"用 Google 账号登录"的 OAuth 授权模式,但其核心差异在于:用户授权后,第三方应用(如 Devin、Notion)可直接调用该用户在 ChatGPT 订阅中已包含的 API 额度和模型能力,而无需应用商自行购买 OpenAI API 积分。这对开发者意味着更低的获客成本——无需自建计费体系;对用户则意味着订阅权益可跨平台复用。这一机制若大规模铺开,将使 ChatGPT 订阅从单一产品演变为 AI 能力的"通行证",对 OpenAI 的平台化战略具有重要意义。
总结
这届 DevDays 的信号很清晰:OpenAI 正全力把能力下沉到开发者工具与企业产品中,Agents API 的计算机操作、云端 Codex、插件生态都在扩大开发者的可操作边界。Decisions API 则代表了对快速决策这一细分需求的押注。
但从体验角度看,新模型 GPT-6.1 Sol 的"迎合式"交互风格引发了实测者的强烈不满——这提醒行业,模型的可信度和抗压表现,正成为比基准分数更重要的差异点。对普通用户而言,不妨先关注已经可用的 Agents API、云端 Codex 和插件扩展,而 Decisions API、Dots 等则值得保持观望。
相关推荐

一场与Grok的对话能否影响重大决策?素材不足的警示
一则关于美国因与Grok对话影响委内瑞拉决策的Hacker News标题引发关注,但缺乏正文与信源。本文探讨此类耸动标题的识别方法与AI在决策中的真实边界。

AI编程为何离不开Git?从版本回退到AI辅助命令全解析
Git是AI编程的必备工具。本文解析Git分布式版本控制在AI编程中的价值,包括应对AI幻觉的版本回退、分支管理等核心操作,以及如何用豆包、AI输入法等工具快速生成Git命令,帮助新手零基础入门。

拒绝AI胡编:一款"说不了谎"的求职信生成器是如何炼成的
一位开发者因AI求职信工具凭空捏造其Kubernetes经验和管理经历而屡遭拒信,于是打造了CoverCraft——通过代码计算评分、GitHub提交记录背书、对抗性审查与人工审批四重机制,构建一款"无法说谎"的AI求职信生成器。本文解析其对抗AI幻觉的工程设计。