GPT-6 Astra + Images 2.5实测:一句话跑完整个工作流

OpenAI新图像模型Images 2.5与电脑操控AI Astra组合,实现一句指令从生图到打印的全自动工作流。
OpenAI推出的ChatGPT Images 2.5在人像一致性、多轮编辑稳定性和参考图处理上达到当前第一梯队水平,并新增Sketch草图生成、标注修改、文字添加、背景移除等功能,且已对所有用户免费开放。与此同时,付费版GPT-6 Astra具备远程操控电脑的能力,可在单一工作流中自主串联Google Drive、ChatGPT、Canva、打印店等多个应用。实测中,UP主李厂长仅凭一套指令,让AI在约40分钟内完成了从生成个人宣传海报到Canva排版再到下单打印的全流程。这次组合实测的意义在于:AI首次能自主担任跨应用的「流程编排者」角色,而非只是单个工具链中的某一环,代表着AI从功能工具向自主协作者演进的实质性一步。
OpenAI近期接连推出了两款重磅产品:图像生成模型 ChatGPT Images 2.5,以及具备电脑操控能力的 GPT-6 Astra。B站UP主李厂长对这两款工具做了系统实测,并把二者组合起来完成了一个真实的商业任务——从生成图片、设计海报到下单打印,全流程只靠一句指令驱动。本文梳理这次实测的核心发现,以及它对AI工作流带来的启示。
Images 2.5:图像一致性大幅提升
新的 Images 2.5 已经向所有用户开放,包括免费用户。在ChatGPT网页端左侧的「图片」入口,或桌面App的聊天/工作模式下都能访问,甚至直接在对话框输入需求也能触发生成。
官方称新模型在细节清晰度、光影质感上都有提升,对参考图片的处理效果尤其明显。实测中,UP主上传了一张自己在新加坡的照片,让模型把衣服换成热带海岛风、手中的抹茶饮料换成甘蔗,结果人像和图片比例保持得非常自然,握甘蔗的手也符合物理规律,几乎看不出破绽。
最关键的进步在于人像特征的稳定性。以往的图像模型每次生成差别都很大,而 2.5 在多轮修改中能保留此前的改动记录,不会像 2.0 那样「改多了就忘」。UP主还测试了生成穿不同颜色衣服的自己,稳定性都很高。
新增Sketch与多种编辑功能
这一版最大的新增功能是「绘图(Sketch)」。在图片类别下点击 Sketch,或在对话框输入 @ 选择绘图,就能在画板上手绘草图,让GPT把它变成成品图。UP主现场画了一个夸张的卡通人物,模型很快就将草图渲染成了完整漫画,还能配合提示词调整风格。

编辑能力也更加丰富:
- 一键调整长宽比:可快速切换到16:9等宽屏比例;
- 标注修改:用笔勾选指定区域让模型局部修改,但UP主提醒指令要写清楚——他只说「把喷泉变大」,结果连喷泉基座也一起放大了;
- 添加文字与元素:在漫画里画一团东西并要求写「中秋快乐」,模型不仅识别出意图,还自动补上了搭配主题的月亮;
- 移除背景生成PNG、擦除工具去除元素。不过擦除时模型往往会自动补上别的物件(如颜料和笔筒),并非单纯删除。
此外还有针对logo、海报、室内设计等场景的模板功能,会自动填充预设指令,比旧版更专业。UP主用澳洲房产网站的客厅图配合室内设计模板做了改造,虽然一开始结果不理想,但经过截图沟通后有明显改善。
GPT-6 Astra:让AI接管整个工作流
真正的价值不在于生成一张图,而在于图片能否作为后续工作的起点。这就要用到 GPT-6 Astra——付费用户升级到最新版后,在工作页选择 Astra 模型,即可授权AI远程操控电脑。UP主个人推荐使用「中等强度」以平衡性能与Token消耗,更高强度效果虽好但消耗惊人。

演示案例中,AI在一个工作流里连续调用了4个应用:先从 Google Drive 读取UP主的照片,用 Images 2.5 生成一张「以李厂长为主角的AI线下宣传活动海报」,再切换到 Canva 自动完成排版,最后生成两份可打印的PDF,并在打印店网站设置好参数、只等填地址付款。
整个过程约40分钟,UP主只提供了一套详细指令并授权应用登录,剩下的全由AI自主完成。他坦言如果自己动手会更快,但意义在于AI首次能自主串联多个应用,而非只做流程中的某一步。工作期间用户仍可继续编辑、撤销步骤,不会破坏工作流。
GPT-6 Astra 本质上是一种「计算机使用(Computer Use)」能力的实现,即AI通过截图感知屏幕状态、模拟鼠标点击与键盘输入来操控真实软件界面,而非调用预设API。这一技术路线与 Anthropic 的 Claude Computer Use、微软的 UFO 项目思路相近,核心难点在于跨应用的状态感知与错误恢复。由于每一步操作都需要截图→理解→决策的完整推理循环,Token消耗极高,这也是UP主建议使用「中等强度」而非最高强度的原因。与RPA(机器人流程自动化)工具的区别在于:RPA依赖预先录制的固定脚本,遇到界面变化就会失败;Astra则依靠视觉理解动态适应,理论上可以操控任何有图形界面的软件,无需提前集成。
意义与局限:AI越来越像身边的同事
UP主认为这套方法论的想象空间很大:调研、周报、文案脚本,甚至未来的音频剪辑、视频渲染和质量把关都可能交给AI,人类只负责最初的创意和最终的判断微调。他还举例——AI可以从多个应用调取信息、财务数据和会议记录,自动整合成一份运营周报,列出优先级、负责人和瓶颈,这些过去都得靠项目经理来做。
当然,2.5 版本仍不完美,UP主列出了几处明显短板:
- 普通图片一致性好,但复杂图像仍有提升空间;
- 擦除时会自行添加别的元素;
- 指令必须写得非常详细才能被准确执行;
- 涉及名人或有版权IP的照片暂时无法生成。
GPT-6 Astra 也并非完全自动,需要用户先登录并逐步授权。但把图像生成与GPT-6组合后,生成的图片可以直接作为下一个任务的原始素材,省去了「下载图片→换软件→再处理」的繁琐流程。
「多智能体工作流(Multi-Agent Workflow)」是理解这次演示更深层价值的关键概念。传统AI应用中,一个模型只负责一项任务(生图、写文案、排版各自独立),用户充当不同工具之间的「胶水层」,手动传递文件和指令。而 Astra 演示的模式中,单个AI实例可以跨越应用边界,自主决定调用哪个工具、何时切换、如何处理中间产物,用户只需在起点定义目标和在终点做判断。这与 OpenAI 此前发布的 Operator、以及 Google 的 Project Mariner 指向同一方向:AI的竞争焦点正从「单点能力」转向「流程编排能力」,谁能更可靠地完成跨应用的长程任务,谁就掌握更大的生产力杠杆。
写在最后
从这次实测看,Images 2.5 在人像一致性、多轮编辑和参考图处理上确实是当前第一梯队的图像模型;而 GPT-6 Astra 展示的「一句话跑完整个工作流」,则代表了AI从工具向自主协作者演进的方向。尽管授权繁琐、耗时偏长,但只要能把流程搭建好,AI就能长期为你持续工作——这或许才是这两款产品组合起来最值得关注的信号。
相关推荐

Swift1.5-Qwen3.8-Flash-Next实测:推理提速60%,质量几乎无损
Swift-1.5-Qwen3.8-Flash-Next实测对比基础版Qwen3.8-Flash:Aider编程基准显示其推理token和耗时降至40%,质量几乎无损,C++场景需留意。本地大模型效率优化实录。

中学生涌入NPR评论区:一场Z世代的网络迁徙
NPR工作人员一度把Spotify播客评论区的古怪留言当成机器人,直到一位Z世代同事识破真相——原来是中学生把这里当成了新的线上聚集地。本文解读青少年网络迁徙背后的代际认知差异与平台治理挑战。

《Factorio》登陆触屏平台:一场工厂建造游戏的交互重构
自动化工厂建造游戏《Factorio》正尝试移植到触屏平台。本文解析开发日志 FFF-447 中揭示的触屏交互重构挑战,以及复杂桌面软件迁移触摸范式的通用启示。