[控场AI]
· 17 分钟阅读· 8,635 字

GPT-5.6与ChatGPT Work发布:AI从对话助手进化为任务执行者

GPT-5.6与ChatGPT Work发布:AI从对话助手进化为任务执行者

文章正文

OpenAI在最新发布会上一口气推出了GPT-5.6模型家族(Sol、Terra、Luna)以及三大重磅产品更新——ChatGPT Work、全新桌面应用和Hosted Sites。这场发布会最值得关注的信号是:AI的定位正从"回答问题"转向"完成任务",从对话助手进化为真正意义上的工作伙伴。

GPT-5.6模型家族:三个层级,覆盖全场景

GPT-5.6并非单一模型,而是一个分层的家族,针对不同使用场景做了明确的性能与成本权衡:

  • Sol:家族中能力最强的模型,专为复杂的agentic工作流设计,适合长周期任务、深度内容理解和高精度执行。
  • Terra:速度更快,面向日常工作流,在响应速度与模型能力之间取得良好平衡。
  • Luna:最快、最经济的选项,专门服务于高并发的大批量任务处理场景。

这种**模型家族化(Model Family)**策略在大语言模型商业化中已成主流。谷歌的Gemini家族(Ultra/Pro/Flash/Nano)、Anthropic的Claude家族(Opus/Sonnet/Haiku)均采用类似的三级或四级分层结构,底层逻辑是"计算成本与任务复杂度匹配"——并非所有任务都需要最强模型,强行使用会带来不必要的延迟和成本。

这一策略的兴起与**推理经济学(Inference Economics)**的成熟密切相关。大语言模型的推理成本由token数量、模型参数规模和硬件利用率共同决定:以GPT-4级别模型为例,其单次推理成本约为GPT-3.5的10-20倍,而许多日常任务(如文本摘要、简单问答、格式转换)并不需要顶级模型的推理深度。Transformer架构在参数规模、上下文窗口与推理延迟之间存在固有的三角权衡——参数越多,每个token的计算量越大,延迟越高,成本越贵。这促使各大AI公司系统性地构建分层产品矩阵:旗舰模型(如Sol)处理需要深度推理的复杂任务,中端模型(如Terra)覆盖日常工作流的性价比需求,轻量模型(如Luna)则以极低延迟和成本承接高并发、低复杂度的批量场景。这种分层不仅是商业策略,更是对Scaling Laws的工程化应用——在给定计算预算下,将模型能力精准匹配至任务所需的最小必要复杂度。OpenAI此次将Sol/Terra/Luna与付费/免费用户的分层叠加,进一步将商业模式与技术架构深度绑定。

**Agentic AI(代理式AI)**是指能够自主规划、调用工具、执行多步骤任务并根据中间结果动态调整策略的AI系统,区别于传统的单轮问答模式。其技术基础包括工具调用(Function Calling/Tool Use)、记忆管理(短期上下文窗口+长期记忆存储)、任务分解(将复杂目标拆解为可执行子任务)以及自我纠错(反思中间输出并修正)。长周期任务执行的核心挑战在于"保持在轨"——随着任务链路延长,模型容易出现目标漂移、幻觉累积等问题。GPT-5.6 Sol专为此场景优化,意味着其在上下文窗口管理、工具调用稳定性和错误恢复能力上均有针对性提升。

值得关注的是,Sol面向所有付费用户开放,Terra和Luna则向免费用户提供——这种分层策略让OpenAI在保证高端能力的同时,有效降低了普及门槛。

据OpenAI披露,目前每周有近10亿用户使用ChatGPT。随着Codex和编程能力的突破,团队内部发现这些模型的潜力已远不止于"给出好答案",而是能够真正"完成大事"。

capable of working

训练背后的技术演进

研究人员Katie和Tejal透露,GPT-5.6是"推理范式"(reasoning paradigm,一种强化学习技术)持续扩展的最新成果。通过同时扩展强化学习和预训练,两者相乘带来了模型能力的指数级跃升。

推理范式是近年来大语言模型训练的核心突破方向。传统预训练主要依赖海量文本的下一个token预测,而推理范式则在此基础上引入强化学习(Reinforcement Learning,RL),让模型通过"尝试-反馈-优化"的循环来学习如何"思考"而非仅仅"记忆"。OpenAI的o系列模型(如o1、o3)最早将这一范式推向公众视野,其核心机制是让模型在回答前生成一段"思维链"(Chain-of-Thought),并通过结果奖励信号强化正确的推理路径。

这一突破的深层根源在于对"扩展律"(Scaling Laws)的重新理解。OpenAI研究员最早在2020年提出预训练损失与计算量之间存在幂律关系;而o系列的成功则证明,**推理时计算(Inference-Time Compute)**同样存在类似规律——给模型更多"思考时间",其表现可以持续提升。这一洞见催生了"思维预算"(Thinking Budget)的概念:不同于训练阶段对参数规模的一次性投入,推理时计算允许在运行时动态分配计算资源——简单问题快速回答,复杂问题深度思考。这意味着同一个模型可以根据任务难度"按需扩展",从根本上改变了能力与成本之间的固定关系。将AI能力扩展的路径从单纯的训练规模竞赛,扩展到了训练与推理的双轨并进策略。GPT-5.6将预训练规模扩展与RL规模扩展同步进行,理论上两者的协同效应呈乘法而非加法关系——这也是为何研究人员用"指数级跃升"来描述能力提升的原因。

一个颇具象征意义的细节是:5.6 Sol已能够自主完成对Luna的后训练(post-training)。研究人员只需给Codex一个相对简短、甚至"未充分说明"的prompt,模型就能自行找到训练配置、匹配合适的GPU、启动脚本并完成验证。Tejal评价道:"以前这可能需要一个资深研究员团队来做,现在自动化研究员真的已经非常接近了。"

这一细节触及了AI研究的核心命题——"AI自我改进"(AI Self-Improvement)。后训练(Post-Training)通常包括监督微调(SFT)、强化学习人类反馈(RLHF)和直接偏好优化(DPO)等阶段,传统上需要大量人工标注数据、精心设计的奖励函数和复杂的训练管线。

理解这一突破的关键,在于认识到后训练流程的复杂性:一个典型的RLHF流程需要首先收集数千到数万条人工标注的偏好数据对,训练奖励模型(Reward Model),再用PPO(近端策略优化)算法对主模型进行迭代优化——整个过程涉及多个相互依赖的训练阶段、精细的超参数调整和持续的人工监督。如果高能力模型能够自主管理这一流程——自动生成合成训练数据、设计奖励函数、调度计算资源并验证输出质量——意味着AI研发本身开始形成正反馈循环:更强的模型训练出更强的后继模型,研究人员的角色将从"执行者"向"目标设定者"迁移。这与DeepMind的AlphaCode 2、Meta的自动化研究助手等方向遥相呼应,代表着"AI for AI Research"正从概念走向实践。

ChatGPT Work:为高强度工作而生的新伙伴

ChatGPT Work是本次发布的核心产品,被定位为"面向雄心工作的新伙伴",覆盖网页、移动和桌面三端。它在界面逻辑上与传统Chat做了明确区分——Chat适合快速问答、搜索和头脑风暴,Work则是真正"把事情做完"的地方。

we're just going to drag it in.

演示中,工程师Jessica用一条prompt让ChatGPT Work检索Slack消息和员工反馈,找出以有趣方式使用产品的同事,并直接安排线下会面。这类任务横跨多个数据源、涉及日程协调,充分体现了模型在长周期任务中"持续保持在轨"的能力。

财务场景:精度与格式的双重考验

财务团队成员Lauren的演示更具说服力。她展示了如何用ChatGPT Work完成差异分析(variance analysis):过去需要手动对账多个系统、在多个场景下协调Excel预测模型,如今一次操作即可自动跑完全套分析,并清晰解释超出预期的原因与潜在风险。

**财务差异分析(Variance Analysis)**是企业财务管理中极具代表性的高复杂度任务,通常需要跨越多个数据源——ERP系统(如SAP、Oracle)的实际发生数、Excel中的预算模型、BI工具的可视化报告,以及人工记录的业务说明。分析师不仅需要识别数字差异,还需要结合业务背景解释差异成因(如季节性波动、一次性费用、汇率影响等),并评估风险敞口。

这类任务对AI而言的真正难点在于结构化数字推理与非结构化业务语义的融合。识别"Q3实际支出比预算高出12%"只是第一步,更难的是将这个数字差异与散落在邮件、会议纪要和业务说明中的上下文关联起来——是因为新项目提前启动、人员扩张超预期,还是某个一次性的系统迁移费用?传统的BI工具擅长前者,人类分析师擅长后者,而AI系统需要同时做好两件事。财务场景中的错误代价远高于一般工作任务——一个错误的差异解释可能影响数百万美元的预算决策,这使得ChatGPT Work在此场景的表现具有重要的基准意义:它不仅需要计算正确,还需要具备足够的业务推理能力来识别异常背后的真实成因。

更进一步,模型还能直接更新Excel预测模型、生成PowerPoint演示文稿,甚至创建可对外分享的交互式网站(Sites)。Lauren说:"三个月前我们还在用电子表格,现在这些交互式工具已经彻底改变了整个公司的工作方式。"这类工作对精度和准确性要求极高,正是Work与Chat定位差异的最佳体现。

全新桌面应用:AI获得了自己的光标

如果说ChatGPT Work让AI能处理云端任务,那么全新桌面应用则让AI真正"进入"了本地环境——它可以访问本地文件、浏览器标签页,甚至直接操作电脑上的其他应用程序。

Or if you say, help me sort through my inbox,

演示中最令人印象深刻的一幕,是整理Apple Notes的过程。用户只需发出"帮我整理笔记、建文件夹、移动内容,自己看着办"的指令,ChatGPT便获得了独立的光标,在后台自主操作Apple Notes应用,而用户可以同时处理其他事务。

这一能力的技术名称是Computer Use(计算机使用),Anthropic于2024年率先以Claude Computer Use形式公开展示,随后引发行业跟进。其底层实现通常基于视觉语言模型(VLM)对屏幕截图的理解,结合操作系统级别的自动化接口(如macOS的Accessibility API)执行具体操作。与传统RPA(机器人流程自动化)最大的区别在于:Computer Use不需要预先编写固定脚本,模型能够理解自然语言指令后动态决策操作路径,对界面变化具备一定的容错性。

Computer Use能力的实用化面临感知-规划-执行三层挑战。感知层需要VLM将屏幕像素转化为可操作语义:一个典型的1080p屏幕包含超过200万个像素,模型需要从中识别出按钮、文本框、菜单等UI元素,并理解其功能语义——这对视觉语言模型的细粒度理解能力要求极高,分辨率和UI复杂度直接影响准确率。规划层需要模型将自然语言指令分解为具体的UI操作序列,错误的操作规划会导致不可逆的文件损坏或数据丢失;执行层则需要稳定的系统级API调用——macOS的Accessibility API虽提供了结构化的UI树,但大量应用(尤其是Electron应用)的无障碍支持参差不齐。安全边界是这一能力商业化的核心约束——沙箱隔离、操作白名单和用户确认机制是目前主流的风险控制手段。OpenAI在桌面应用中很可能结合了屏幕截图VLM理解与系统API调用的混合路径,以在准确性和通用性之间取得平衡。这标志着AI从"建议者"向"执行者"的实质性跨越。

另一个案例中,模型在约90秒内读完了本地文件夹中的启动就绪PDF、用户访谈报告、安全审计文件,加上三个打开的Chrome标签页内容,随即直接生成了一份符合公司模板、可直接展示的完整幻灯片。模型还调用了记忆功能,将用户此前提到但未正式记录的顾虑也纳入其中。

交互式可视化与Hosted Sites

桌面应用能将杂乱的用户工单表格实时转化为交互式可视化,自动完成分桶、排序、重要性标注,并支持一键发布为Sites,方便团队协作共享。设计师Ed展示的3D交互原型令人眼前一亮——从经典的SVG压力测试到可协作分享的3D原型,全部由5.6 Sol实时生成,无需手写代码,也无需Figma设计文件。

成本效率与Ultra并行模式

面对"如此强大是否意味着高昂成本"的疑问,OpenAI给出了明确回应。Token效率一直是其核心研究方向,在DeepSuite 1.1等主流评测中,GPT-5.6以不到竞品一半的成本取得了更优表现。

And I'm here joined by Katie and

话说回来,OpenAI推出了Ultra模式:释放一整个agent团队为用户并行工作。Multi-Agent(多智能体)架构是指将单一复杂任务分配给多个并行运行的AI代理协同完成的系统设计模式,其灵感来源于人类团队协作——不同agent可以专注于子任务(如一个负责信息检索、一个负责代码生成、一个负责结果验证),通过协调者(Orchestrator)整合输出。

Multi-Agent系统的理论根源可追溯至分布式人工智能(Distributed AI)和多智能体系统(MAS)研究,早在1990年代学术界就已建立了完整的博弈论框架。现代LLM时代的Multi-Agent实践面临新挑战:Agent间通信协议的标准化(OpenAI推出的Agent Communication Protocol是重要尝试)、任务分解的合理性(错误的分解策略会导致子任务间信息损耗)、协调者本身的可靠性(Orchestrator失败会导致整个系统崩溃)。

理解Ultra模式的商业逻辑,需要将其置于AI计算资源分配的大背景下。单一Agent模型受限于串行处理——即便有足够长的上下文窗口,模型在生成每个token时仍是顺序推理的。多Agent并行架构通过将任务分解后分发给多个独立运行的模型实例,从根本上突破了这一瓶颈:理论上,一个可以分解为N个独立子任务的工作流,其完成时间可以压缩至单Agent的1/N。然而并行化也带来了显著的额外成本:多个Agent同时运行意味着token消耗呈线性乃至超线性增长,协调者本身也需要消耗大量tokens来整合各Agent的输出。研究表明,在复杂软件工程、科学研究和长文档处理等任务中,multi-agent系统的表现显著优于单一大模型——尤其是当任务可以被合理分解且子任务间依赖较少时,并行化收益最为明显。这也解释了为何Ultra模式与高价订阅绑定:其价值主张是"用更高的计算成本换取更短的任务完成时间和更高的质量上限"。评测显示,随着agent数量增加,模型能像一支经验丰富的团队一样并行处理任务,完成质量更高、速度也更快。该功能已引入Codex应用,回应了开发者社区长期以来的需求。

在基准评测方面,5.6 Sol在Terminal Bench(编程能力)、BrowseComp(信息定位)、Agent's Last Exam(长周期专业任务)等前沿评测中均达到当前最优水平,据称速度是同类模型的三倍。

安全强化、网络防御与真实世界应用

随着模型能力持续增强,安全对齐的重要性也随之提升。**AI安全对齐(Alignment)**旨在确保模型行为与人类意图和价值观保持一致。**红队测试(Red Teaming)借鉴自网络安全领域,指专门组建团队以"攻击者"视角主动寻找模型的安全漏洞、有害输出和越狱路径。OpenAI在红队测试上投入了超过70万A100等效计算小时,进行了为期六周的安全训练与测试,并引入了新的分类器和激活探针(Activation Probes)**等监控机制。

激活探针代表着AI安全领域从行为主义到机制主义的范式迁移。早期的对齐工作主要依赖RLHF对输出结果进行约束,本质是一种"黑盒行为干预"——模型被训练成倾向于产生符合人类偏好的输出,但其内部推理过程仍是不透明的。激活探针则通过在模型内部特定层植入线性分类器,监控与有害意图相关的内部神经网络激活状态,在有害输出生成之前就进行干预。其技术原理基于一个关键发现:模型在生成有害内容时,其中间层的激活模式与正常内容存在可统计区分的差异,这些差异可以被轻量级的线性分类器捕捉。与输出层过滤相比,激活层监控具有两个优势:其一是时序优势,干预发生在内容生成之前而非之后;其二是绕过难度更高,攻击者无法通过调整措辞来规避内部激活模式的检测。这与Anthropic的机械可解释性(Mechanistic Interpretability)研究遥相呼应——两者都试图理解模型"为什么"产生某种输出,而非仅仅过滤"什么"输出,代表着安全监控从"黑盒输出过滤"向"白盒内部监控"的技术演进方向。

在网络安全方向,通过"Project Daybreak"计划,研究人员已借助5.6 Sol在所有主流浏览器和数据库中成功发现安全漏洞。AI辅助漏洞挖掘正在成为网络安全领域的重要新范式:大语言模型能够快速理解大规模代码库的语义逻辑,识别出传统静态分析工具难以发现的逻辑漏洞(如权限绕过、竞争条件、内存安全问题等)。更广泛的"Patch the Planet"计划则直接与开源项目合作,生成高质量安全补丁——其中Linux社区接受了超过一半的AI生成补丁。

这一比例本身具有重要的工程意义,需要放在Linux内核开发的严苛背景下理解。Linux内核社区是全球技术标准最高的开源协作组织之一:每个补丁都需要经历严格的代码审查,维护者不仅关注功能正确性,还要求补丁符合内核编码规范、不引入性能回归、附带完整的commit message说明设计意图。历史上,即便是经验丰富的工程师提交的补丁,首次接受率也不总是令人满意。AI生成补丁超过50%的接受率,意味着模型不仅能识别漏洞、生成功能正确的修复代码,还能理解并遵循人类工程师的协作规范——这是从"能写代码"到"能参与工程协作"的质的跨越,证明模型能自动完成修复,大幅提升网络防御效率。

从办公室到北海道农场

发布会最令人动容的案例,来自日本北海道的农民Hiroki。他并非工程师,却用Codex为大棚的通风电机搭建了自动化控制系统。在新模型加持下,Codex"只需一个prompt就能读取数据库、自主调用各类工具",即便无人监督,也能围绕最终目标持续推进。Hiroki用ChatGPT完成日英实时翻译分享心得时,给出的建议朴素而有力:从小处着手,逐步搭建。

Hiroki的案例具有超越技术本身的象征意义。它揭示了Agentic AI真正的民主化潜力——当"执行复杂系统"不再需要工程学背景时,受益群体将从硅谷工程师延伸至全球各地的小型从业者。这与早期互联网让信息获取民主化、智能手机让移动计算民主化的历史轨迹高度相似:每一轮技术民主化都会创造出此前完全无法想象的新应用场景,其边界往往由最边缘的使用者最先触及。值得关注的是,农业自动化控制本是一个对工程门槛要求极高的垂直领域——传统的温室控制系统需要专业的嵌入式工程师编写PLC(可编程逻辑控制器)程序、配置传感器接口和设计容错逻辑。Hiroki案例的深刻之处在于:他不是在使用一个"农业专用AI工具",而是用一个通用的代码生成代理,自主完成了原本需要专业工程服务的定制化系统搭建。这预示着未来AI普及的路径:不是为每个垂直行业专门开发应用,而是让通用Agentic能力足够强大,使得各领域的从业者能够自行构建所需工具。

结语:提升你的雄心水平

这场发布会反复强调同一个主题——"raising the level of ambition"(提升雄心水平)。当AI具备了操作本地应用、跨源整合信息、自主执行长周期任务的能力后,真正的瓶颈不再是技术本身,而是使用者是否敢于想象、敢于让AI承担更大的事情。

所有产品更新和模型将在24小时内陆续推出:Sol面向所有付费用户,桌面应用、ChatGPT Work和Sites同步开放,Terra和Luna则向免费用户提供。AI从"回答问题"到"完成工作"的转折点,或许就在此刻。

核心要点

分享:

相关推荐