GPT-6 Astra实测对比5.6:8小时4组任务谁更强?

UP主8小时实测GPT-6 Astra与5.6,前者需求理解与自主执行能力全面领先,视频剪辑是唯一例外。
B站UP主香酥幻想用四组八轮共计超8小时的实战测试,对比了GPT-6 Astra与5.6在真实工作流中的表现差距。测试涵盖前端UI重构、游戏复刻、视频剪辑和清明上河图3D互动化四个方向。结果显示,Astra在需求还原度、产品逻辑理解和自主工具调用(如自动下载Blender便携包)上全面优于5.6,尤其在抽象提示词下依然能交付高质量成果;5.6则胜在速度更快,但频繁偏离需求细节。唯一例外是视频剪辑,5.6因正确调用了预置的Remotion skill而反超,但测评者认为这更多源于提示词歧义而非模型能力本身的差距。
一次跨越8小时的模型硬核对比
B站UP主香酥幻想做了一期真刀真枪的模型评测,用完全相同的提示词,让GPT-6 Astra与前代模型5.6分别跑同一套任务。四组案例、八轮测试,累计耗时超过八小时——光是等所有任务跑完就到了凌晨。这种「实战交付」式的测评方式,比跑分表更能反映模型在真实工作流中的差距。
测试涵盖四个方向:AI创作台的前端UI重构、复刻经典小游戏「泡泡糖」、把40多分钟素材剪成成片、以及清明上河图的3D互动化。所有测试双方都开到「高」思考强度,账号为5X的Pro等级。UP主特别提到一个额度数据:这8个测试加上其他任务,两天时间消耗掉了周额度的80%。
前端UI重构:抽象需求下的理解力差距
第一组前端重构做了两个版本。第一版提示词故意写得极其抽象——只有一句「我喜欢苹果产品那种清晰舒适的感觉」,剩下全靠模型自行理解现有页面并调整。这其实还原了大量非设计背景用户的真实场景:只会用「简洁大气」这类形容词提要求。
结果差距明显。5.6跑了25分钟(其中还中途反问喜欢哪张图,被要求自己判断后又花18分半),最终产出几乎等于没重构——依旧是AI偏爱的蓝紫配色,暗色模式下按钮文字都看不清。Astra直接用半小时给出第一版,在同样抽象的描述下,视觉层次和导航设计都明显更胜一筹,且没有犯「暗色文字看不清」这类低级错误。

第二版把提示词写得更具体:苹果式简洁精致、卡片布局、主次分明。这一版Astra给出了最大惊喜——它主动把一个原本没放进工具栏的H3提示词扩写功能拎到首页合适位置,展现出对产品逻辑的理解。暗色模式切换第一眼就很舒适。反观5.6,切换主题色时会卡顿,动效虽努力但排版依旧混乱。

值得一提的是速度对比:5.6两轮加起来不到一小时,比Astra快很多。但正如UP主所说,快而不达标并没有意义。
游戏复刻与3D互动:需求还原度是分水岭
第二组复刻童年游戏泡泡糖,两个模型耗时接近(5.6约27分钟,Astra约34分钟)。差异体现在细节还原上:Astra把文档里要求的道具——增加水柱长度、增加泡泡数量等全部实现,整体视觉更舒适;而5.6遗漏了多个明确写在提示词第五条里的道具需求。
最能拉开差距的是清明上河图3D互动这一组。提示词要求不只是自由行走和改变路线,还要能进入小空间完成买茶、问路等互动。5.6只用23分钟就出片,速度惊人,但产出完全偏离方向——互动功能一个没实现,UP主直接放弃了第二版。

Astra第一版用56分钟,出来后发现严重掉帧(浏览器帧率只有1帧,因为没调用显卡),修复用了34分钟。虽然画面依然粗糙,但可以问路、有路线指引、按Shift加速、跟茶铺店家和船家交互、甚至能登船,地图和原画对照都做得有模有样。第一版其实已经完整实现需求,UP主才让它精修了一遍(又花约一个半小时)。
一个技术细节令人印象深刻:由于电脑没装Blender,Astra在精修时自己下载了Blender便携包来完成建模操作。这种自主调用外部工具的能力,让UP主看到了它辅助3D建模乃至视频制作的潜力。

Blender是一款开源的3D创作套件,支持建模、渲染、动画、视频编辑等功能,在专业3D制作流程中应用广泛。「便携包」(portable version)是一种无需安装、解压即可运行的软件形式,通常以压缩包分发。Astra能够在检测到本地环境缺少必要工具时,自主联网下载对应便携包并调用,意味着它不仅能生成代码,还能主动感知和补全执行环境的依赖——这在AI Agent能力框架中属于「工具使用」与「环境感知」的结合,是当前大模型从「对话助手」迈向「自主执行代理」的关键能力边界之一。
视频剪辑:唯一Astra落败的场景
第四组视频剪辑是本次唯一5.6表现更好的任务。UP主给了两段共40多分钟的素材(含大量嘴瓢、重复),要求剪成成片。两个模型的成片都存在没剪干净重复片段的问题,都不算及格——5.6成片13分54秒,Astra是14分27秒,还莫名加了一圈边框。
UP主分析了5.6反超的可能原因:项目里要求「允许使用通用工具不额外安装专门指导本次剪辑的skill」,而Remotion这个skill是项目里原本就有的。5.6把这句话理解为可以调用已有skill,成功用上了Remotion;而Astra没有调用该skill,可能因此表现打了折扣。这更像是提示词歧义导致的理解偏差,而非模型能力的绝对高下。
Remotion是一个基于React的程序化视频创作框架,允许开发者用代码描述视频的时间线、动效和剪辑逻辑,而非通过传统时间轴拖拽操作。在AI Agent的工作流中,「skill」通常指预先配置好的工具调用能力或功能模块,类似于插件。本次测试中,Remotion skill已被预置在项目上下文里,两个模型对「允许使用通用工具」这句提示词的解读差异,直接决定了是否调用这一现成能力。这也说明,在提示词工程中,工具授权的描述方式对模型最终行为有显著影响,模糊的边界条件容易引发不同模型截然不同的执行策略。
实测结论:能力提升明显,但仍有短板
综合四组八轮测试,Astra在前端设计、游戏复刻、3D互动这三类需要深度理解和自主执行的任务上,相较5.6有「天壤之别」的提升,尤其是在需求还原度和自主工具调用上表现突出。5.6则胜在速度快,以及在视频剪辑这一特定场景下因skill调用逻辑而占优。
关于使用建议,UP主给出了一条实用经验:日常使用把思考强度开到「高」就完全足够,没必要每个任务都拉满,除非面对几万行乃至十几万行代码的复杂重大调整。作为单一来源的实战评测,这期视频的价值在于用真实工作流暴露了两代模型在「听懂需求并交付」上的代差,也提醒大家提示词的措辞会直接影响工具调用行为。
相关推荐

Robinhood高管将亮相TechCrunch Disrupt 2026谈现代金融消费者
Robinhood产品营销副总裁Abhishek Fatehpuria将亮相TechCrunch Disrupt 2026,分享如何赢得现代金融消费者。早鸟报名9月25日前最高省200美元。

用ChatGPT批量生成可编辑学术PPT:科研人的效率工具实战
分享用ChatGPT批量生成可编辑学术PPT的完整流程:只需文献PDF、PPT模板和一段提示词,先出图再拼合转可编辑,半小时完成美观汇报PPT,并对比了ChatGPT与Codex的适用场景。

GPT-6满血版使用教程:通过GPT-work开启Ultra最高思考强度
本文详解如何付费使用GPT-6满血版:从Apple ID注册、Plus/Pro套餐充值,到通过GPT-work客户端工作模式开启GPT-6 Ultra最高思考强度与完整权限,并附网页版隐藏解锁路径。