[控场AI]
· 5 分钟阅读· 2,561 字

GPT-6 Sol与Luna发布:价格砍半、性能追平Opus

GPT-6 Sol与Luna发布:价格砍半、性能追平Opus

OpenAI发布GPT-6 Sol与Luna,价格腰斩同时企业任务性能反超Anthropic Opus 5,编程效率提升三倍。

OpenAI发布GPT-6 Sol与Luna两款模型,以"智能度持平、价格大幅下降"的策略同时打响价格战与性能战。价格层面,Luna定价已低于DeepSeek V4 Pro,Luna Max单任务成本仅为V4.1 Flash的四分之一,直接冲击国产模型长期占据的低价区间。性能层面,在Automation Bench企业自动化工作流测试中,GPT-6 Sol High以33.2%的完成率超越Opus 5的26.9%,且成本仅为其十分之一;编程场景下,开发者实测任务耗时从约一小时缩短至约20分钟,Token消耗减半。新模型已向Plus、Pro、Business、Enterprise、Azure及API用户全面开放,并为订阅账户附赠一次额度重置。这轮发布的核心逻辑是:当模型智能度趋于同质化,成本效率与响应速度正成为下一阶段竞争的决定性变量。

OpenAI再度掀起模型迭代与价格战的双重浪潮。据B站UP主的解读,最新发布的GPT-6 Sol与Luna两款模型,凭借智能度持平上一代、价格却腰斩的策略,直接把竞争对手Anthropic的Opus系列与DeepSeek推到了尴尬的位置。这一轮更新的关键词,不再是单纯的"智力",而是"又轻又快又便宜"。

价格战:Luna已低于DeepSeek

此次发布最直观的冲击来自价格。GPT-6 Sol在智能度几乎与上一代拉平的前提下,价格整整下降了一半。而Luna的降价幅度更为激进——其定价已经低于DeepSeek广告 V4 Pro在闲时未命中缓存下的价格。

更极端的是GPT-6 Luna Max,其单任务成本据称已经来到DeepSeek V4.1 Flash的四分之一。要知道,V4.1 Flash此前一直被视为性价比标杆,如今这一"价格王者"的位置被直接动摇。这种成本结构的重塑,意味着OpenAI不再只在高端旗舰赛道竞争,而是主动下探到过去由国产模型主导的低价区间。

对于大规模调用API的企业用户而言,成本降到原来的四分之一,几乎等于把可负担的任务规模翻了数倍,这才是价格战真正的杀伤力所在。

DeepSeek V4.1 Flash是深度求索(DeepSeek)推出的轻量级推理模型,定位于高并发、低延迟的API调用场景,此前凭借极低的输入/输出token单价在开发者社区中建立了"性价比天花板"的口碑。DeepSeek的价格体系通常分为命中缓存(cache hit)与未命中缓存(cache miss)两档,前者费率大幅低于后者,因此在实际成本计算中需区分调用模式。文章中提及Luna在"闲时未命中缓存"下仍低于DeepSeek V4 Pro的报价,意味着即便在DeepSeek最不利的定价场景中,Luna也具备价格优势,这一对比口径对企业用户的实际采购决策更具参考意义。

现实任务表现进入巅峰

如果只是便宜,还不足以称之为"斩杀"。真正让对手难受的是,GPT-6在真实世界任务上的表现同样强势。

Automation Bench测试中

在Automation Bench测试中,GPT-6 Luna在较高推理强度下以大约1%的成本追平了GPT-5.6 Sol。而在覆盖销售、运营、客服、财务和人力的自动化工作流评测里,GPT-6 Sol High取得了33.2%的成绩,高于Cloud Opus 5在最大推理强度下的26.9%。

值得深挖的是成本对比:GPT-6 Sol High在拿下更高分数的同时,单项任务成本仅为Opus 5的十分之一。性能更优、价格却是对手零头,这种组合对企业级自动化场景几乎构成了碾压。这也解释了标题中"狙击Opus 5.5"的说法——OpenAI瞄准的正是对手最看重的企业自动化市场。

Automation Bench是一套专为评估AI在企业级自动化场景中实际表现而设计的基准测试,区别于传统学术性基准(如MMLU、HumanEval),它模拟真实业务流程中的多步骤任务,涵盖销售线索处理、运营数据整合、客服工单分派、财务报表生成和人力资源筛选等场景。该测试的核心指标并非单步准确率,而是端到端的任务完成率,因此更能反映模型在复杂工作流中的实用价值。测试结果同时记录每项任务的token消耗,使得"性价比"(单位成本完成率)成为可量化的比较维度,这也是GPT-6 Sol High"成本仅为Opus 5十分之一"这一数据的来源语境。

又轻又快:编程效率的实测提升

这一轮更新的胜负手,被UP主明确概括为"不在智力,在于又轻又快"。

如今经常可以在约20分钟内完成

在真实代码库的软件工程测试中,GPT-6 Sol几乎拉平了Cloud Fable 5的最高成绩。开发者Flavio Damo在提前试用后给出了一个颇具说服力的数据:过去在GPT-5.6上通常需要约一小时的任务,如今经常能在约20分钟内完成,且Token消耗还不到原来的一半。

速度提升三倍、成本减半,这对依赖AI辅助编程的开发者而言是实打实的生产力变化。当模型不再是瓶颈、调用成本大幅下降时,AI编程的使用频次和场景边界都会随之扩展。

此外,OpenAI产品负责人Tibo Sotio宣布,Plus、Pro和Business账户将获得一次预存的使用额度重置,让订阅用户能在现有周期内多使用一轮额度。这一举措明显是在配合新模型发布,鼓励用户尽快上手体验。

可用渠道与订阅方式

这一段大约三分钟

据介绍,GPT-6 Sol和Luna已面向Plus、Pro、Business、Enterprise以及Azure用户开放。API用户则可以直接通过GPT-6 Sol和GPT-6 Luna两个模型标识调用新模型。

对于国内用户,UP主提供了两种思路。第一种是通过网页端注册订阅,流程相对简单,只需切换语言、注册邮箱并完成验证即可。第二种是通过手机应用商店配合礼品卡付款的方式,但这种方法对动手能力和网络环境要求较高。

如果的成功率尚可

UP主提醒,安卓端由于环境、设备等限制,成功率仅维持在40%左右,并不推荐;礼品卡付款成功后,通常在5到10小时内到账均属正常,需要预留足够时间。

提示:涉及第三方渠道订阅存在账号与支付风险,读者应自行评估合规性与安全性,谨慎操作。

写在最后

GPT-6 Sol与Luna这次发布,展现的是一条清晰的战略路线:在保持智能度的前提下,用成本和速度构建护城河。价格砍半、企业任务性能反超Opus、编程效率翻倍——三张牌叠加,直接把价格战和性能战同时打向了竞争对手。

当模型性能趋于饱和,成本效率与响应速度正在成为下一阶段竞争的核心变量。对开发者和企业用户来说,这或许意味着可以用更低的预算获得更强的自动化能力。

分享:

相关推荐