Grok 4.6实测:性能、定价与Cursor收购深度解析

过去两年,全球AI大模型市场似乎只剩下OpenAI和Anthropic两大玩家。而Grok(xAI)尽管开局声势浩大,却很快归于沉寂,长期停留在第三梯队。但就在最近几天,情况发生了根本性变化——随着xAI完成对Cursor的收购,并发布全新的Grok 4.6模型,这家公司正以惊人的速度追赶头部阵营。本文将结合科技博主Matthew Berman的实测分析,深入解析Grok 4.6的性能表现、定价策略,以及Cursor收购背后的深层逻辑。
Grok 4.6性能解析:从迭代升级到全面提升
Grok 4.6并非全新的训练成果,而是基于Grok 4.5的迭代升级(dot upgrade)。在大模型行业,「dot upgrade」与「全新模型」有本质区别。全新模型意味着从头开始的预训练(pre-training),需要消耗数百万至数十亿美元的算力。而点版本升级则是在已有基础模型之上,通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术,针对特定能力域进行强化——成本更低、迭代更快,但受限于基础模型的「天花板」。这也是为什么xAI能在收购Cursor后短时间内发布性能显著提升的新版本。
正如xAI在官方博客中所强调的,这是一次「巨大的改进」。其核心焦点非常明确——代码能力与知识工作(knowledge work),而这一切都源自对Cursor的收购。
有意思的是,Grok 4.5此前已成为许多开发者在Cursor中的默认子代理(sub-agent)模型,因其能力强、速度快而备受青睐。而Grok 4.6在此基础上不仅性能全面提升,速度还进一步加快,这对于追求响应速度的用户来说是个不小的惊喜。
基准测试成绩:多项领先,部分仍有差距
从多个权威基准测试来看,Grok 4.6的表现相当亮眼:
- GDPVal(OpenAI推出的知识工作评测):Grok 4.6 High拿下第一名,超越了竞争对手;
- Harvey Lab(法律场景评测):以15.8%的成绩大幅领先,远超对手的2.5%和11.3%;
- Terminal Bench:从上一代的15%跃升至26%;
- Cursor Bench:与Fable 5 Max基本持平,未能夺魁;
- DeepSuite(被认为最贴近真实编程体验的评测):以65.9分位列第三,落后于GPT-5.6 Sol Max(73分)和Fable 5(70%)。

这一点值得警惕:许多模型在跑分上表现优异,但真实编程使用时体验却「不对味」。这背后是AI行业长期存在的「benchmark overfitting(基准过拟合)」问题——模型通过针对性训练刷高特定测试分数,却未必提升真实能力。DeepSuite之所以更具参考价值,在于它模拟的是完整的软件工程任务流:理解需求、拆解问题、生成代码、处理边界情况、调试修复,而非单纯的代码补全或算法题。这类「端到端任务评测」更难被刷分,因为它需要模型在多个维度上同时表现稳定。Grok 4.6在此仍与顶级模型有一定距离,说明其真实编程场景的综合能力仍有提升空间。
Grok 4.6成本分析:性价比的真实较量
Matthew Berman反复强调一个观点:只看质量分数是不够的,成本同样重要。他推荐使用Artificial Analysis的智能指数(Intelligence Index)作为综合参考。
在这一排名中,Grok 4.6 High从上一代的位置一跃升至第四名,与GPT-5.6 Sol并列——Claude Opus 5位居第一,Fable 5第二。但真正决定价值的是「每任务成本」(cost per task)这一维度。
这里有个重要的分析框架:每任务成本取决于两个因素——模型消耗多少token,以及每个token的价格。大模型的计费以「每百万token」为单位,但仅看单价会产生误导,因为不同模型完成同一任务时消耗的token数量差异显著。尤其是「思维链(Chain-of-Thought)」推理模型,往往生成大量中间推理步骤,消耗远超普通模型的输出token。Artificial Analysis等第三方机构通过构建标准化任务集、统一测量各模型的token消耗,计算出真实的每任务花费。以Kimi K3 Max为例,虽然其单价只有Sol和Fable的一半,但由于消耗了两倍的token,实际总成本几乎持平。对于高频调用场景,每任务成本的差异会随调用量指数级放大,因此这一指标在生产环境选型中往往比原始性能分数更具决策价值。
从数据来看,Grok 4.5 High的每任务成本约36美分、智能指数约55-56;而Grok 4.6虽然智能指数提升到约60,但成本也上涨到约83美分。相比之下,它比同等智能水平的GPT-5.6 Sol Max更便宜,与Kimi K3价格相当但智能略高。理想的模型应位于「高智能、低成本」的左上角绿色象限,Grok 4.6虽然更贵了,但整体仍具竞争力。
实测对比:Grok 4.6设计能力仍是短板
在一项相同prompt生成「设计感个人资料卡片」的实测中,三大顶级模型表现各异:
- Fable 5:表现糟糕,生成的图像被形容为「最烂的SVG画图作品」;
- GPT-5.6 Sol:设计优美、干净、视觉吸引力强,明显胜出;
- Grok 4.6:不错但不完美,图像尚可,但按钮被裁切、缺少内边距、文字间距略显奇怪。

结论很清晰:在主观性较强的设计任务上,GPT-5.6 Sol依然领先,Grok 4.6处于中游水平。设计类评测虽难以量化,但差距肉眼可见。这类任务对模型的空间推理能力、审美理解和细节把控要求极高,往往是代码生成能力提升最难直接迁移的领域。
Grok 4.6定价与产品生态:面向更广阔的市场
Grok 4.6的定价极具竞争力:输入200万token为2美元,输出600万token为6美元。作为对比,GPT-5.6 Sol的价格是其数倍,Fable更贵。这使得Grok 4.6成为一个高效且廉价的「主力(workhorse)」模型。
此外,xAI还提供了速度翻倍的Fast变体(价格翻倍),并在首周为Cursor和Grok Build用户提供双倍用量优惠。该模型目前已可通过Cursor、Grok Build、API以及OpenRouter调用。
更值得关注的是全新产品Grok Bot——这是Cursor推出的面向更广泛、非技术用户的产品。它彻底剥离了模型选择功能(用户甚至不知道自己在用哪个模型),也不显示任何代码,只呈现文本和PPT、Word等知识工作产物。每个对话线程都是一个独立的Agent,还配有可爱的小吉祥物。这标志着xAI正瞄准比开发者更庞大的普通用户市场。
xAI收购Cursor的深层逻辑:数据与算力的完美联姻
要理解xAI今天的定位,必须回顾这段历史。今年4月,xAI收购了Cursor——这家曾彻底改变编程方式的公司。Cursor是基于VS Code深度改造的AI原生代码编辑器,由Anysphere公司推出,迅速成为开发者社区中最具影响力的AI编程工具之一。它的核心创新在于将大语言模型深度嵌入编辑器工作流:不仅提供代码补全,还支持多文件上下文理解、自然语言代码生成、对话式调试,以及「Agent模式」——让AI在用户监督下自主完成复杂的多步骤编程任务。随着Claude Code和Codex的崛起,它逐渐失去了部分开发者的青睐,但其积累的海量真实编程交互数据依然是极为宝贵的战略资产。

这次收购的价值在于互补性:
- Cursor拥有海量宝贵的编程数据,却没有数据中心和GPU来训练自己的模型;
- xAI则在122天内建成了20万块GPU的集群(即「Colossus」集群),速度惊人,但苦于没有好模型,导致大量算力闲置。
在大模型时代,算力与数据是两种最关键的生产要素,且两者缺一不可。编程数据尤为稀缺——真实的代码-自然语言交互数据、用户修改AI生成代码的反馈数据、跨越多文件的长上下文编程任务数据,这些都难以从公开语料库中直接获取,必须通过实际产品积累。Cursor每天处理数百万次真实开发者的编程请求,积累的这类数据集是xAI无法通过爬取互联网获得的。数据 + 算力的结合,催生了强大的新一代编程模型。
这也印证了当前大模型的「制胜公式」——死磕编程场景,以及由此形成的飞轮效应。这一飞轮的结构是:开发者大量使用编程工具产生真实交互数据,数据用于训练更强的编程模型,更强的模型吸引更多开发者,形成闭环。这一飞轮最早由Anthropic系统性构建:开发者使用Claude Code,数据和收入反哺Anthropic,再用编程模型训练下一代模型。OpenAI随后通过收购Windsurf并推出Codex CLI复制了这一模式并追平差距,如今xAI也走上了同样的路径。这一模式的战略意义在于:它将产品收入、用户增长和模型能力提升三者绑定在一起,构建出极高的竞争壁垒——后来者不仅要追赶模型能力,还要同时追赶数据积累。
递归自我改进的信号
xAI在博客中明确提到,他们用Grok 4.5来训练Grok 4.6——利用4.5重新生成SFT轨迹(涵盖推理、Agent框架,以及STEM、软件工程、知识工作等领域)。
「SFT轨迹」特指包含完整推理过程的训练样本——不仅有最终答案,还有逐步的思考链、工具调用序列或Agent行动记录。用上一代模型生成SFT轨迹来训练下一代模型,其技术基础是「知识蒸馏(knowledge distillation)」的变体:强模型的输出分布往往优于人工标注的简单答案,因此用它来生成训练数据能带来质量提升。这正是「递归自我改进」的雏形——AI能力提升的路径正从「人工数据驱动」向「模型自举(model bootstrapping)」演进。虽然尚未形成完全闭环的自我进化AI,但当前各大实验室都在用上一代模型训练下一代模型,Grok亦不例外。
AI竞争格局:xAI的算力筹码与未来展望

一个耐人寻味的细节是:由于Anthropic低估了自身模型的需求,转而向xAI购买算力。Matthew Berman形象地将此比喻为「向敌人出售武器」——考虑到马斯克此前对Anthropic的诸多负面评价,这笔交易想必让他内心复杂。
但潜在的隐忧在于:一旦Grok 4.6开始吸引大量需求,在与Anthropic的合约到期后,xAI很可能将全部GPU算力转向自家的Cursor和Grok。对Anthropic的Dario而言,这或许是个值得警惕的信号。
而xAI的脚步并未停止。马斯克已发推透露,Grok 4.7比4.6显著更强,预计三到四周内就绪,初步训练已完成,接下来将加入大量SpaceX公司数据进行补充训练。
结语:第三大AI实验室的崛起
Grok 4.6的发布标志着美国AI市场正式迎来第三大主要实验室——继OpenAI和Anthropic之后,xAI凭借Cursor收购带来的数据优势和自身庞大的算力储备,正以极快的速度缩小差距。尽管在设计能力和部分真实编程体验上仍与顶尖模型有距离,但其低价、高效、快速的特性,以及面向大众市场的Grok Bot产品策略,都让它成为一个不容忽视的力量。
正如Matthew Berman所言:竞争是好事。无论是开源模型还是闭源前沿模型的竞争,最终都意味着更好的模型和更低的价格,这对所有用户都是福音。
核心要点
相关推荐

Fable 5.1实测:AI一键生成3D游戏场景,碾压GPT和Grok
实测对比Fable 5.1、GPT-5.6 Sol、Grok 4.6、Kimi K3在3D游戏场景生成上的表现。从哥特建筑到只狼主菜单,详细拆解各模型在细节保真度、渲染速度和交互复刻上的真实差距。

AFK Agent:让AI在你离开键盘时自主编码
深入解析AFK Agent模式如何将AI编程从人在环中(HITL)升级为无人值守的自主执行。通过多阶段计划分解和自动化循环,工程师可以并行调度多个AI代理,实现编码效率的范式转移。

数据科学免费学习资源指南:零预算高效入门路径
预算有限如何学数据科学?本文整理Kaggle Learn、freeCodeCamp、Fast.ai等免费优质学习资源,提供从Python基础到机器学习的完整自学路线,帮助零基础者高效入门数据科学。