GPT-6 Astra实测:SVG生成质量超越GPT-5.6全系列

开发者实测GPT-6 Astra:最低推理级别即超越GPT-5.6 Sol全部级别,性价比显著领先。
知名开发者Simon Willison通过让不同模型生成"骑自行车的鹈鹕"SVG图像,对GPT-6 Astra与GPT-5.6系列进行了系统对比。结果显示,Astra即便在最低推理级别(low)下,生成质量也全面超越GPT-5.6 Sol在任何级别的最佳表现,且仅需9.55美分。尽管Astra单价约为Sol两倍,但其更低的token消耗量大幅压缩了实际任务成本差距。技术层面,Astra与Luna的输入token计数相同(均为16个),暗示两者可能共享底层架构。此次测试为开发者提供了"低推理级别新模型可能优于高推理级别旧模型"的重要实践参考。
GPT-6 Astra的首次实战测试
知名开发者Simon Willison在获得GPT-6 Astra访问权限后,进行了一项有趣的对比实验:让不同模型生成"骑自行车的鹈鹕"SVG图像。他测试了GPT-6 Astra在low、medium、high、xhigh和max五个推理级别下的表现,并与GPT-5.6的三个变体(Sol、Terra、Luna)进行了全面对比。
这个看似轻松的测试实际上揭示了新模型在图形生成、推理效率和成本效益方面的显著进步。通过对比网格的直观呈现,我们可以清晰地看到GPT-6 Astra在多个维度上的优势。
生成质量:代际差异明显
测试结果显示,GPT-6 Astra在图像生成质量上实现了质的飞跃:
即使是最低推理级别的Astra,其生成的鹈鹕图像也优于GPT-5.6 Sol在任何推理级别下的最佳表现。 Simon特别指出,GPT-5.6 Sol即使在xhigh级别(他认为比max更好)生成的鹈鹕,看起来仍然像是"一堆抽象形状的组合"。相比之下,Astra从low到xhigh级别的每一个输出都更加逼真和协调。
Astra在max推理级别下的表现尤为出色,生成的鹈鹕图像细节丰富、结构合理。不过有一个有趣的细节:在低于max的推理级别时,Astra仍然无法可靠地将鹈鹕的腿绘制在车架的两侧——这个细节问题在最高推理级别才得到解决。
成本效益分析:更少token,更高性价比
从定价来看,GPT-6 Astra的价格约为GPT-5.6 Sol的两倍:输入token为10美元/百万(Sol为5美元),输出token为50美元/百万(Sol为30美元)。但实际使用成本却并非简单的翻倍关系。
关键发现在于token使用效率: Astra在各个推理级别下使用的token数量都明显少于Sol。这意味着虽然单价更高,但实际任务成本的差距被显著缩小。
最具说服力的例子是Astra low级别的表现:仅需9.55美分,就能生成比GPT-5.6 Sol在任何级别、任何价格下都更好的鹈鹕图像。在其他模型上花费10美分,得到的结果质量都远不及此。这种性价比优势对于需要大规模生成图像的应用场景不能忽视。
技术细节:Astra与Luna的潜在关联
Simon在对比中发现了一个耐人寻味的技术细节:输入token计数方面,Astra和Luna都使用了16个token,而Sol和Terra使用了26个token。
这种一致性引发了一个有趣的猜测:Astra和Luna之间是否存在比OpenAI官方披露更深的技术关联?虽然这只是基于有限数据的推测,但token使用模式的相似性可能暗示着两个模型在tokenizer或底层架构上存在共同点。
对开发者的启示
这次对比测试为AI应用开发者提供了几点实用参考:
- 选择合适的推理级别:对于图形生成任务,Astra low可能已经足够满足大多数场景需求,无需默认使用最高级别
- 重新评估成本预算:不要仅看模型单价,token使用效率同样关键
- 质量优先策略:在追求输出质量的场景下,新一代模型的低推理级别可能优于旧模型的高推理级别
GPT-6 Astra的这次测试展示了大语言模型在多模态生成能力上的又一次重要进步,也为我们理解不同模型之间的性能差异提供了直观的参考案例。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。