Ollama改用积分制:老Pro用户切换将损失67%额度

事件概览:Ollama付费方案重大调整
近日,本地大模型运行工具 Ollama 宣布调整其付费方案,根据官方所称的"用户反馈",将原有的固定算力套餐转向**积分制(credit model)**计费。这一变动在 Reddit 社区引发热议,一位仍在使用旧版 $20 Pro 套餐的用户发出提醒(PSA):如果你还在老计划上,千万不要点击切换按钮,否则实际可用额度可能大幅缩水。
Ollama 是一款开源的本地大语言模型运行框架,允许用户在自己的电脑上下载、运行和管理各种开源大模型(如 Llama、Mistral、Gemma 等)。它的核心卖点是极大简化了本地部署大模型的技术门槛——用户无需手动配置 Python 环境、下载模型权重、处理量化格式等繁琐步骤,只需一行命令即可运行模型。除了免费的本地运行功能外,Ollama 还提供云端付费服务,让用户可以调用更强大的闭源模型或获得更高的算力支持,而此次争议正是围绕这部分付费服务展开。
这类由固定套餐转向按量计费的调整,在 AI 工具订阅领域并不罕见,但对于重度用户而言,往往意味着实际成本的显著上升。这位用户在切换前做了一笔详细的账,结果让他庆幸自己没有贸然操作。

新旧方案对比:一笔关键的账
该用户基于自己真实的使用模式进行了详细测算,核心数据对比如下:
旧方案 vs 新方案的token额度差异
- 旧版 $20 Pro 套餐:每月约可获得 21 亿(2.1B)tokens 的 Deepseek v4 flash 用量。
- 新版 $20 积分套餐:提供 $60 的积分额度,换算到相同工作负载下,约等于 7 亿(700M)tokens。
这里需要解释一下 token 这一核心计量概念。在大语言模型领域,token 是文本处理的基本计量单位,一个 token 大致等于英文中的 3/4 个单词,或中文中的 1-2 个汉字。模型每处理一个 token 都需要消耗 GPU 算力,因此 token 数量直接决定了 API 调用的成本。Token 分为输入 token(用户发送的提示词)和输出 token(模型生成的回复),通常输出 token 的单价高于输入 token,因为生成过程需要逐个推理计算。当我们说 21 亿 tokens 时,这个数字涵盖了输入和输出的总量。
关于用户测算中提到的 Deepseek v4 flash 模型,这里也值得展开。Deepseek 是由中国 AI 公司深度求索推出的大语言模型系列,"flash" 后缀通常表示该模型是经过推理优化的轻量化版本,在保持较高能力的同时大幅降低推理成本和延迟。这类 flash 模型在行业中越来越流行——Google 的 Gemini Flash、Anthropic 的 Claude Haiku 都是类似定位。用户选择 Deepseek v4 flash 进行测算,说明其工作负载追求的是性价比而非极致性能,这也解释了为什么他的 token 消耗量如此巨大——低单价模型往往被用于大规模批量处理任务,如文档摘要、数据提取或自动化代码生成等场景。
说个细节,这一测算已经考虑了他自身使用场景中高达 97% 的缓存命中率(cache hit)——也就是说,即便在极为有利的缓存条件下,新方案能提供的 token 数量仍然只有旧方案的约三分之一。
所谓缓存命中率,在大模型 API 调用场景中指的是 KV Cache(键值缓存)的复用比例。当用户多次发送相似前缀的请求时,模型不需要重新计算已经处理过的 token 的注意力键值对,而是直接从缓存中读取结果。97% 的缓存命中率意味着该用户的工作负载中绝大部分请求都共享相似的上下文前缀——这在批量处理、RAG(检索增强生成)管道或代码补全等场景中非常常见。许多 API 服务商对缓存命中的 token 给予大幅折扣(通常为正常价格的 1/4 到 1/10),因此高缓存命中率本应显著降低实际成本。然而即便算上了这个有利因素,新方案的 token 额度依然大幅缩水,这恰恰说明了新旧方案之间的差距有多大。
换算下来:
| 方案 | 月费 | 可用 tokens(Deepseek v4 flash) |
|---|---|---|
| 旧 Pro 套餐 | $20 | 约 21 亿 |
| 新积分套餐 | $20 | 约 7 亿 |
同样花 $20,token 数量减少了约 67%。 对于一个每月消耗数十亿 token 的用户来说,这几乎意味着单位成本翻了三倍。
为什么会出现这种差异?
固定套餐与积分制的本质区别
固定算力套餐的逻辑是"包月无忧":只要在算力上限内,用户无需关心每次调用的具体消耗,边际成本趋近于零。这对重度用户极为友好,因为高频、大量的调用被摊薄到一个固定价格里。
而积分制则将每一次 token 消耗都明码标价。$60 的积分听起来比 $20 的套餐"给得更多",但一旦按实际 token 单价折算,重度用户的用量很快就会把积分消耗殆尽。
简单来说:
- 轻度用户:积分制可能更划算,用多少付多少,不浪费。
- 重度用户:积分制是明显的成本上升,固定套餐的性价比优势消失。
"基于用户反馈"的调整背后
Ollama 官方将此次变动归因于"用户反馈"。从商业角度看,固定套餐若被少数重度用户消耗掉大量算力,供应商的成本压力会非常大。转向积分制,本质上是把成本更精确地转嫁给高消耗用户,这在订阅制 AI 服务中是一种常见的商业修正手段。
事实上,这种计费模式的演变正在整个 AI 行业中上演。早期许多服务(如 ChatGPT Plus 的 $20/月固定订阅)采用类似"自助餐"的定价策略,用户享有较高的使用上限。但随着用户规模扩大,供应商逐渐发现少数重度用户的 GPU 算力消耗远超预期,导致边际成本难以覆盖。OpenAI、Anthropic 等头部公司都曾因此不断调整速率限制或推出分级定价方案。积分制本质上是将定价权从"包月自助餐"转向"按菜点单",对供应商而言能更精确地控制成本结构,但也意味着当价格透明度提高后,重度用户会明显感知到实际支出的上升。Ollama 的这次调整,正是这一行业趋势在中小型 AI 工具服务商身上的又一次体现。
不过,这也提醒我们:平台方所说的"优化"或"回应反馈",未必对所有用户群体都是好消息。 对个体用户而言,最可靠的判断依据永远是基于自身真实使用数据的测算,而非官方宣传中的"更多额度"字样。
切换前必做:实用成本测算指南
四步算清你的真实成本
这起案例最大的价值,在于它展示了一个朴素但极易被忽视的原则:在点击"升级"或"切换"按钮前,用自己的真实用量做一次成本测算。
具体步骤如下:
- 统计真实用量:查看自己每月实际消耗的 token 数量,不要凭感觉估算。大多数 AI 服务都提供使用量仪表盘或 API 调用日志,这些是最可靠的数据来源。如果使用 Ollama 本地服务,可以查看其日志中的 token 统计信息。
- 换算新方案单价:将新套餐提供的积分金额除以你使用模型的 token 单价,算出实际可用 token 数。需要注意的是,不同模型的 token 单价差异极大——顶级模型(如 GPT-4o、Claude Opus)的价格可能是轻量级模型的 10-50 倍,因此务必按自己实际使用的模型来计算。
- 考虑缓存因素:如果你的工作负载有较高的缓存命中率,把这一优惠纳入计算,让对比更贴近真实场景。可以通过分析请求中共享前缀的比例来估算自己的缓存命中率。
- 横向对比:把新旧方案在相同价格、相同工作负载下的 token 数量直接放在一起,差异一目了然。
重度用户的应对策略
对于像本案例这样每月消耗数十亿 token 的重度用户,套餐制被替换为积分制往往是不利信号。几点建议:
- 如果旧方案仍然可用,优先保留旧方案,这通常是更经济的选择。在 SaaS 行业中,保留老用户原有计划(所谓"祖父条款")是一种常见做法,但供应商也可能在未来某个时间点强制迁移,因此需要持续关注相关公告。
- 关注 Ollama 是否会强制迁移旧套餐用户,提前做好备选方案。
- 评估其他本地部署方案或替代服务,看是否能以更低成本满足高频调用需求。对于有一定技术能力的用户,完全本地化的部署方案(如使用 vLLM、llama.cpp 等工具直接在自有 GPU 上运行模型)虽然前期投入较高,但在长期大规模使用场景下,单 token 成本往往远低于任何云端付费方案。
结语
Ollama 从固定套餐转向积分制的调整,本身是订阅服务演进中的常见一步,但对不同用户群体的影响差异巨大。这位 Reddit 用户通过一次简单的测算,避免了额度缩水 67% 的损失,也为整个社区提了个醒。
在 AI 工具订阅日益普及的今天,"看起来更划算"的新方案未必真的划算。养成在变更计费方案前主动核算成本的习惯,是每一位 AI 工具用户都应具备的基本素养。
相关推荐

Stitch AI:刺绣数字化AI智能体,15秒生成生产级机器文件
Stitch AI是首个刺绣数字化AI智能体,能像专业数字化师一样解读图稿,自动规划针迹方向、密度和拉伸补偿,15秒内生成DST/PES机器文件、生产说明表和效果图,大幅降低刺绣定制的时间与成本门槛。

deepeye:浏览器内实时检测深度伪造的免费工具
deepeye是一款免费Chrome扩展深伪检测工具,无需上传文件即可实时识别AI生成的伪造头像、视频通话和语音消息,覆盖图像、视频、音频三种模态,助你防范AI诈骗。

Claude Fable 5.1深度解析:Anthropic最强编程与知识工作AI模型
Claude Fable 5.1是Anthropic推出的最先进编程与知识工作模型,基于Claude 5 Mythos架构,支持API调用、CLI及IDE插件。本文深度解析其核心能力、与Mythos 5.1的区别及部署方式。