开放模型重构AI经济:Ollama创始人揭示企业token消耗真相

Ollama CEO揭示:开放模型正主导企业80-90%的token消耗,编程Agent与Flash模型引爆新一轮AI基础设施变局。
Ollama联合创始人兼CEO Jeffrey Morgan通过掌握900万开发者的真实token流量数据,描绘了一幅与主流叙事不同的AI企业格局:开放模型(包括中美两国血统)正在成为企业token消耗的绝对主力,预计占比将达80%-90%。驱动这一转变的核心是编程Agent和AI协同工具的爆发,叠加上下文窗口从128K跃升至百万级,Ollama Cloud单用户token用量实现约5倍跃升,整体增长150倍。Morgan预判企业将形成"合伙人-助理"式的模型分工格局:前沿闭源模型处理最难任务,开放模型承担大量流水线工作;Flash模型则将承担"体力活",把价值链推向编排与策展层。
在AI基础设施竞赛中,一个被低估的趋势正在企业内部发生:开放模型正在成为企业token消耗的绝对主力。Ollama联合创始人兼CEO Jeffrey Morgan近日做客YC旗下播客The Light Cone,分享了他从token流量最前线观察到的第一手数据。
Ollama目前拥有900万开发者、17.8万GitHub星标,被85%的财富500强企业采用。Morgan掌握着一个独特视角——他不仅知道哪些模型在基准测试中得分最高,更知道开发者真正下载并持续使用的是哪些模型。
开放模型的崛起:从成本痛点到定制化能力
Morgan观察到的最大变化,是企业级市场正在大规模转向开放模型,且这些模型混合了美国和中国的血统。驱动力主要来自编程Agent和AI助手这类协同办公场景。
对于"企业转向开放模型是否只是为了降成本"这一问题,Morgan给出了层次分明的答案:
"成本是开放模型能够解决的最大痛点。但每家企业真正的North Star,是想要获得对AI更好的控制权,并针对自己的业务进行定制。成本是短期能解决的,但它进而让企业能去为自己独特的用例定制这些模型。"
他援引了《The Information》关于AT&T的报道:这家电信巨头已经将40%的token消耗转移到了开放模型上,目前主要是美欧模型,但也在评估中国模型。

阻碍开放模型采用的真正门槛
你可能没注意到,阻碍企业采用中国模型的核心障碍并非能力,而是安全与合规。Morgan表示,从他们与欧美客户的交流经验看:
"如果你能解决安全问题,采用中国血统的模型实验室基本是完全可行的选项。这对这些企业来说非常令人兴奋。"
这也为安全与治理领域的创业公司创造了巨大机会。
Token用量爆发:编程Agent引爆的拐点
Morgan展示了一张Ollama Cloud上单个开发者周token用量的曲线图,其中有两个关键拐点:
- 第一个拐点出现在年初,由编程Agent驱动。随着Kimi、GLM、Minimax等模型发布,开放模型终于能够驱动编程Agent。
- 第二个拐点出现在4月,AI协同工具的爆发式增长让非开发者(财务、支持、营销、销售人员)也能把复杂问题交给开放模型自动完成。
数据令人震撼:单用户token用量实现了约5倍跃升;而从年初至今,Ollama Cloud整体token消耗增长了150倍。
背后的技术推动力,是上下文窗口从128K跃升至百万级以上,让Agent能够在长时间跨度内自主判断使用什么工具、抓取什么数据。
微调回归还是开箱即用当道?
播客中一个有趣的讨论是关于AI行业的"周期性"。早期大家热衷于微调自己的定制模型,随后热度消退——因为微调的成果很容易被下一个模型发布"碾压"。如今这股风潮似乎又回来了。
Morgan的判断颇具辩证性:
- 一方面,模型发布节奏越来越快(DeepSeek Flash一个夏天就迭代了三次,过去是六个月周期),这让定制训练变得更难。前沿闭源模型和开放模型之间的差距正在收窄,可能已不足三个月。
- 另一方面,工具链正在变得更好,让想微调的团队能够跟上节奏。
更关键的转变是:早期开放模型大多以"定制模型"形式服务(如Cursor把DeepSeek或Kimi微调后大规模部署),而开箱即用的开放模型直接被服务,真正起飞是在最近。
Ollama的角色:开放模型时代的"操作系统"
Morgan用了一个恰当的类比来定义Ollama的定位——它像老时代的操作系统,需要与所有驱动、硬件紧密集成,并在应用层确保所有应用调优良好。

他将成功的"Day Zero模型发布"拆解为三个必须打包好的要素:
1. Harness(框架)
无论是开箱即用的harness还是SDK。如今有大量优秀的开源harness,如开源的Codex harness、广受Ollama用户欢迎的OpenCode。
2. 模型本身
确保模型可用、可靠。云端场景下要有足够容量,因为Day Zero往往是增长最大的一天。
3. 硬件与提供商
与NVIDIA、Apple Silicon栈等合作伙伴优化推理速度。"如果模型很强但很慢,那不是好体验。"
Morgan坦言,这是一个组合爆炸式的难题。很多要素都是在模型发布前最后24小时才凑齐的,"通常是一场消防演习"。而Ollama的价值在于提供了一个统一的运行时,能把任意harness匹配到任意模型,形成一个可清晰理解的标准。
前沿模型vs开放模型:企业的稳态格局
关于企业未来在闭源前沿模型与开放模型间的支出平衡,Morgan给出了明确预测:
"在企业内部,绝大多数token将是开放模型,大约80%-90%。但这不意味着80%-90%的预算流向开放模型——实际上你可能只花10%-20%的成本,但你的token用量会很高。"
这形成了一个精妙的组织类比:就像律师事务所里合伙人(前沿模型)把工作分派给助理(开放模型)。最难的任务留给汇聚了顶尖研究者的前沿实验室,而大量"流水线"工作则由开放模型完成,两者协同工作。
这也印证了一个越来越清晰的趋势:不会有一个统治一切的"上帝模型",而是通过编排将多个更小、更专业、更简单的模型链接起来。任务组合让结果更可重复、更可信、成本更可控。
本地模型的文艺复兴:桌面硬件的飞跃
Ollama起家于本地运行(在MacBook上运行开放模型),因此Morgan对本地与云端两个世界都有独特观察。
新一代硬件让20B到120B参数区间的模型运行体验大幅提升。Morgan提到一个惊人对比:GLM某些版本在编程上已能媲美Opus级别,而它可以在"从商店能买到的第二低配MacBook"上运行。
更值得关注的是NVIDIA的DGX Spark和DGX Station。前者提供128GB统一内存,可运行20-120B模型;后者搭载GB300,甚至可以像迷你数据中心机架一样堆叠,运行400B级别的大模型,且价格并不比传统工作站高出太多。
Morgan判断本地与云端将是混合模式:简单任务(如文档处理)本地运行、延迟更低、成本更低甚至接近免费;而编程Agent这类硬任务目前仍以云端大模型最有效。他预言随着硬件追上,本地编程体验(如100毫秒级的自动补全)终将回归桌面。
从模型来源看,两张对比图颇为醒目:本地模型中美国与中国模型旗鼓相当,而云端托管的编程Agent几乎100%是中国模型——这也侧面说明市场亟需更多美国实验室发布大型开放模型(如Nemotron Ultra正是这一波的开端)。
Flash模型:回归"无限token"时代
对于预算有限的创业者,Morgan推荐关注新一类超低成本、超低延迟的Flash模型,如DeepSeek Flash。
"我们都记得ChatGPT时代,你不用去想用了多少token,每天随便用。最终我们会回到那种状态。"
这类模型"对80%的任务足够好",将成为承担所有"体力活"的工作马。更重要的是,通过前面提到的编排层,可以把多个Flash模型链接起来解决更复杂的问题——这是留给创业公司和推理提供商的巨大机会。DeepSeek Flash目前正是Ollama Cloud上增长最快的模型。
从"荒野迷失"到爆发:Ollama的创业启示

Ollama的故事本身极具戏剧性。Morgan和联合创始人Michael此前在Docker打造了Docker Desktop,深谙开发者体验。他们以"面向Kubernetes的Docker Desktop"的想法申请YC,但直到推出Ollama——中间经历了从Kubernetes安全到桌面开发者安全的多次转型。
那段"荒野迷失"的时期异常煎熬。带着10多人的团队却找不到真正的"North Star",Morgan坦言:"看不到North Star甚至更可怕。"
转折点是一次"从零开始"的头脑风暴。团队给自己两周时间发布第一版Ollama,恰逢Llama 2发布。凭借"行动偏好",他们在两周内完成了从想法到发布的全过程,并迅速获得了比过去所有产品都多的用户。
值得玩味的是,Ollama这个名字并非源自Llama模型,而是代表"Open models"(开放模型)+ LLM,加上一个可爱的动物吉祥物形象。
Ollama的GitHub星标增长速度远超Docker和Kubernetes。它从Reddit上的"发烧友玩家"社区,仅用约18个月就完成了到85%财富500强的跨越——正如访谈中的类比:"PC用了10年从家酿计算机俱乐部走向大众,而这次只用了12-18个月。"
背后的深层原因是:开放模型免费、可随处运行、无需申请权限,这对财富500强的IT开发团队和发烧友同样友好,加上LLM是无状态的,让企业迁移异常顺畅。
curation才是新的稀缺性
Morgan最后点明了Ollama的核心价值主张:当模型、推理技术、云服务和harness构成一个碎片化的宇宙时,把这一切整合成"真正能用"的东西,就是极有价值的curation(策展)问题。
"当模型和提供商极大丰富时,将它们整合成可用的东西就成了新的稀缺性。"
对于只想构建自己软件的开发者而言,他们不需要面对推理提供商晦涩的错误、未文档化的参数、JSON格式的雷区。Ollama以及OpenCode、OpenRouter这类服务的存在,正是让开发者能够专注于构建下一个应用、下一家公司。
开放模型改变的不只是技术选择,更是整个AI的经济学逻辑——token的丰裕正在把价值链上移,而如何编排、如何curation、如何在丰裕之上创造可靠体验,才是接下来最激动人心的战场。
相关推荐

Rootprint:基于S3对象存储的低成本开源日志搜索工具
Rootprint 是一款基于 Quickwit 和 S3 对象存储的开源日志与追踪搜索工具,支持倒排索引全文检索,月存储成本仅300美元即可保留24个月日志。适合个人开发者和小团队的轻量级可观测性方案。

OpenAI声称攻克数学难题:AI推理能力的重大突破
OpenAI宣布其AI代理解决重要数学开放性问题,引发学术界广泛争议。深度解析AI数学推理能力突破的意义、验证挑战及对科学研究的深远影响。

告别1Password:自托管密码管理器全方案对比
深度对比Vaultwarden、PassBolt、AliasVault、KeePass等自托管密码管理器方案,从Passkey支持、2FA、家庭共享到迁移成本,帮助你找到替代1Password的最佳选择。