GPT-6 Sol和Luna降价一半,为何榜单没涨?

GPT-6旗下Sol与Luna价格砍半,但综合榜单分数几乎未动,性价比提升比能力跃升更值得关注。
OpenAI将GPT-6家族中的Sol和Luna两款模型大幅降价至上一代促销价的一半,Sol定价2/10美元、Luna定价0.1/0.5美元(每百万输入/输出词元)。然而在Artificial Analysis综合指数中,Sol仅48分、Luna仅37分,与Opus 5.5的58分相比显得平淡。这种"价格腰斩、分数未涨"的反差并不意味着模型原地踏步,而是综合指数的平均效应掩盖了任务级别的进步:Sol在编程智能体方向小幅提升,Luna在自动化终端任务上有改善,但在需要完整交付的知识工作中更容易露出细节短板。三款模型各有分工,Astra主打能力上限,Sol面向复杂推理与智能体,Luna则服务于低成本大批量场景。对开发者而言,合理的做法是用真实任务测试成功率、返工次数与总花费,而非单凭综合排名做选型决策。
降价一半,分数却没大涨
OpenAI这次对GPT-6家族中的Sol和Luna两款模型进行了大幅调价,价格几乎砍到上一代促销价的一半。按标准API的短上下文价格计算,Sol每百万输入和输出词元约为2美元和10美元,Luna则低至0.1美元和0.5美元。这个降幅足够抢眼,但问题在于——综合榜单分数几乎没动。
据B站菜花睡前AI播客的分析,这次最明显的变化是「变便宜」,而能力进步则要按具体任务分开来看。换句话说,Sol和Luna的最大新闻不是它们冲上了总榜第一,而是把大规模使用的成本压了下来。

从产品定位上看,三款模型各有分工:Astra仍是OpenAI最强的那一档;Sol面向较复杂的编程和智能体任务;Luna则瞄准便宜、快速、需要大量重复处理的工作。这种分层意味着,用一把「综合指数」的尺子去量所有模型,本身就容易得出误导性的结论。
榜单数字背后:进步藏在任务细节里
在Artificial Analysis的综合指数中,同一天发布的对比格外扎眼:新出的Opus 5.5拿到58分,Sol是48分,Luna是37分。Opus的高分很醒目,相比之下Sol和Luna像是「原地踏步」。
但把48分和37分直接解读成「基本没进步」并不准确。综合指数把十种测试揉在一起,适合看全貌,却不适合替你决定每一项具体工作。评测机构的观察更细致:Sol在编程智能体指数上小涨了两分,Luna反而降了两分;在一些自动化和终端任务上有进步,而知识工作的交付物却更容易在细节上露怯。

这不是一个简单的「升级」或「倒退」,而是不同任务给出不同答案。有知乎用户提到OpenAI和Anthropic似乎走上了两条路:一条继续冲刺最高能力上限,一条则把重心放在让更多人用得起。从这次发布的反差来看,这种感觉确实有其依据。
Artificial Analysis的综合指数是业内常用的模型横向比较工具,它将编程、数学推理、知识问答、指令遵从等约十项基准测试的得分加权合并为一个数字,方便跨模型、跨厂商的快速对比。这种设计的优点是直观,缺点同样明显:一旦某款模型在某几项任务上大幅提升、在另几项上原地踏步,综合分数的变化就会被"平均"掉,无法反映真实的任务级能力差异。此外,不同测试的权重设置本身也会影响最终排名——一个偏重数学推理的权重体系,可能让擅长代码生成的模型显得"不温不火"。这正是为什么同一批评测数据,对日常做文字处理的用户和对天天写代码的开发者,可以得出截然不同的选型结论。
别只看一个总分
一个核心观点值得反复强调:不要只凭一个综合排名去判断最前沿的模型。如果你天天用模型改代码,真正该关心的是它提交的改动能不能直接合并;如果你让它做研究,就该看报告有没有漏掉关键要求。
至于外界猜测OpenAI是不是「故意不重视某个榜单」,目前并没有证据替公司下这样的结论。能确定的事实只有一个:它把Astra留在最高能力档,而Sol和Luna则明确瞄准了更多人用得起的日常任务。降价一半,本质上卖的是大规模使用时的性价比,而不是让这两款模型去抢总榜第一。
降价一半,对开发者意味着什么
对经常调用接口的人来说,降价最直接的好处是——同样的预算可以多跑几轮。一个实用的组合思路是:把简单的分类、资料整理交给便宜的Luna,再把需要连续推理的部分交给Sol,整体成本可能比所有步骤都用大模型要低得多。

不过这只是选型方向,并不等于自动省钱。完整任务要把失败重试、人工检查和等待时间都算进账本,不能只盯着每百万次调用的标价。便宜的模型如果反复返工,算总账未必划算。
知乎上的评价也印证了这种任务依赖性:有人夸Sol回答干脆、做事快;也有人反映它做复杂项目容易「走偏」,在长任务里会忘记原先的流程,需要人来推动。这些看似矛盾的反馈,其实说的是不同任务下的不同结论——早期个案都值得听,但不能拿一次成功或失败给模型盖棺定论。
API定价中的"每百万词元"(per million tokens)是当前大模型计费的标准单位,输入词元和输出词元通常分开计价,因为生成文本比处理输入消耗更多算力,所以输出价格普遍高于输入价格。以Luna为例,0.1美元/百万输入词元和0.5美元/百万输出词元,意味着一次包含约750个汉字输入和3750个汉字输出的对话,成本不到0.001美元。这个价格对单次调用几乎可以忽略,但当一个自动化流水线每天跑数百万次任务时,输入输出的比例结构、重试次数和提示词长度就会对月度账单产生数量级的影响。因此,在做成本估算时,除了对比标价,还需要实测自己典型任务的平均输入输出比,才能得出真实的单任务成本。
怎么选才不被榜单带着跑
把Sol、Luna和前一天发布的Opus 5.5放在一起,到底该怎么选?这里有一个不被榜单牵着走的实用方法:拿你真实会做的三件事——一件简单重复、一件稍长的编程、一件需要完整交付的文稿,用相同要求分别测试,记录能否做成、要改几轮、花多久、总共多少钱。

Luna、Sol、Opus甚至Astra,都在这样一本「账本」上竞争。最高分和最适合日常使用,往往不是同一个答案。
所以这次真正的变化,并不是又换了一个模型名字。竞争正在从「谁把总榜刷得最高」,扩大到「谁能让更多工作以更低成本完成」。Sol和Luna降价一半冲击力十足,但榜单持平也在提醒我们:省钱不等于每项能力都升级。别急着宣判赢家,把自己的任务跑完再决定要不要换。
相关推荐

离子推进器:赢得太空竞赛的慢速火箭
离子推进器以极低推力、极高效率成为太空深空探测与货运物流的关键技术。本文解析离子引擎的工作原理、氙气推进剂的选择、太阳能与核电推进的权衡,以及它为何可能成为建造星际文明的"慢速火箭"。

人类造过最快的东西:帕克太阳探测器的43万英里时速
人类建造过最快的物体不是旅行者号或火箭,而是NASA帕克太阳探测器,时速约43万英里。本文解析它如何借助金星引力辅助与太阳引力井加速,以及为何以光速衡量人类仍刚刚起步。

美光CEO警告:内存供应将在未来两年持续趋紧
美光CEO表示存储芯片供应将在未来两年比当前更为紧张,AI需求激增与产能扩张滞后是主因。本文分析内存供应趋紧的原因及其对市场和消费者的影响。