Ollama Cloud深度解析:一份订阅畅跑DeepSeek与GLM等开源大模型

Ollama Cloud按Token透明计价,一份订阅覆盖DeepSeek、GLM等20多个开源模型,对中国用户有时区红利。
Ollama Cloud是Ollama本地大模型工具的云端延伸,核心改变是将推理从用户本地迁移到数据中心,保持原有命令行体验不变。改版后采用透明按Token计价,取消服务费,一份订阅即可调用包括DeepSeek、GLM、Kimi、千问在内的20多个开源模型。价格上,Pro套餐20美元/月内含约60美元额度,最便宜的模型每百万Token输入仅0.15美元;不同模型之间Token用量差距可达6倍,选对模型比选对套餐更关键。接入方式支持终端命令、Agent集成和兼容OpenAI的API三种形式,本地与云端模型可以混用。对中国用户而言,官方Peak高价时段恰好错开北京时间白天,形成天然的时区红利,白天使用速度更快、价格更低。
Ollama作为全球最流行的本地大模型运行工具,最近对云服务进行了一次彻底改版。核心变化是:按Token明确计价、取消服务费,一份订阅即可直接调用DeepSeek、GLM、Kimi、千问等几十个开源大模型。对国内用户而言,这可能是目前最值得关注的Token订阅方案之一。本文基于B站UP主的实测体验,梳理Ollama Cloud的定位、模型库、价格结构以及对中国用户的独特优势。
Ollama Cloud到底改了什么
Ollama的核心体验一直是「一条命令,在本地跑大模型」。云端版本本质上只改了一件事——把推理从你的电脑搬到Ollama的机房,其余全部不变。
你在终端里输入ollama run glm-5.3-flash,Cloud用的还是同一个Ollama、同一套命令,只是背后跑的是数据中心里的大参数模型。这种「无缝迁移」的设计降低了迁移成本,本地和云端可以自由切换。
需要强调的一点是:这并不是转卖各家官方API,也不是从官方API池里分流,而是Ollama用专属算力直接跑原生开源权重,与英伟达云服务商合作托管。官方承诺不记录、不训练用户数据,这一隐私政策相对干净。
它同样可以直接当API使用。Ollama.com提供兼容OpenAI的接口,Claude Code、Codex这类编程Agent都能直接接上。
模型库:一份订阅覆盖20多个开源模型
模型库是Ollama Cloud最大的卖点。一份订阅即可覆盖20多个开源模型,涵盖当前主流的开源阵营:
- DeepSeek V4 Flash 与 V4 Pro
- GLM 5.3 与 GLM 5.3 Flash
- Kimi K3 与 K2.7
- Minimax M3、千问3.5的397B版本
- GPT-OSS 120B 与 20B,以及其他开源模型
其中Kimi K3拥有约2.8万亿参数,是目前最大的开源模型之一。这种规模的模型,本地硬件基本无法承载,而在云端一条命令就能跑起来。所有模型都支持工具调用(tool calling),上下文窗口从131K到1M不等,适配不同的任务需求。
对于既想用开源模型、又不想折腾GPU的用户来说,模型库的丰富度是Ollama Cloud区别于单一模型API服务的关键。
工具调用(tool calling)是指大模型在生成回复时,能够主动调用外部函数或API来获取信息、执行操作,例如查询天气、搜索数据库、运行代码等。这一能力是构建Agent应用的基础——没有工具调用支持,模型只能被动回答问题,无法主动完成多步骤任务。上下文窗口(context window)则决定了模型在单次对话中能「记住」多少内容,131K约对应10万汉字,1M约对应80万汉字。对于需要处理长文档、长对话或大型代码库的场景,更大的上下文窗口意味着更少的信息截断和更连贯的理解能力。
透明的Token计价与套餐结构
改版后,Ollama Cloud采用透明的按Token计价,取消了服务费,也没有5小时和每周的使用限额,额度按月刷新。套餐结构大致如下:
- Free:0美元,赠送少量额度
- Pro:20美元/月,包含约60美元的用量额度
- Max:100美元/月,包含约300美元额度,支持10个并发请求
- Team:500美元,约1000美元额度,团队共享

模型按Token收费,价格差异明显。最便宜的DeepSeek V4 Flash输入约0.22美元/百万Token、输出约0.66美元/百万Token;GLM 5.3 Flash的输入更是低至0.15美元/百万Token。
社区实测显示,Pro套餐跑DeepSeek V4 Flash一个月能跑约100亿Token,而同样的钱跑GLM 5.1只剩约16亿Token,差距高达6倍。这说明选对模型比选对套餐更重要。后台可以清楚看到每个请求花了多少钱,成本完全透明。

Token是大模型计费和处理的基本单位,并非等同于字符数。对于英文,1个Token大约对应4个字符或0.75个单词;对于中文,由于汉字信息密度更高,通常1个汉字对应1至2个Token。「百万Token」(1M Token)是行业通用的计价单位,以DeepSeek V4 Flash为例,输入0.22美元/百万Token意味着输入约100万个中文字的成本不到两块钱人民币,属于目前市场上较低的价格区间。理解输入与输出分开计费这一点同样重要:发给模型的内容按输入价计费,模型生成的回复按输出价计费,而输出价通常是输入价的2至4倍,因此生成内容较多的任务(如长文写作)实际成本会高于纯阅读理解类任务。
三种接入方式:终端、Agent与API
接入云端模型有三种主要方式,覆盖了从命令行到编程Agent的不同场景。
第一种:直接在终端跑。 安装最新版Ollama,运行ollama signin登录账号,然后用ollama run加上带Cloud标记的模型名,例如glm-5.3-flash-cloud。
第二种:用Ollama Launch接入Agent。 一条命令即可把云端模型接入各种Agent,支持Claude Code、OpenCode、Hermes Agent等工具。
第三种:当常规API Key使用。 生成一个API Key,接口兼容OpenAI,就能接入DeepSeek Harness这类Agent工具。

更实用的是,本地模型和云端模型可以混着用——小任务走本地、大任务走云端,一份代码两边通吃。UP主的实际用法是常驻6个模型(GLM、GLM Flash、DeepSeek V4 Pro/Flash、Kimi K3、Minimax M3),按任务大小切换。其Max套餐当月300美元额度仅用了28.62美元,光GLM 5.3 Flash就跑了3091次请求,性价比可见一斑。
Ollama Launch是Ollama提供的一项快速集成命令,核心作用是在本地或远程环境中自动配置模型端点,省去手动设置API地址、端口和认证信息的步骤。兼容OpenAI接口(OpenAI-compatible API)则意味着Ollama Cloud的API请求格式与OpenAI官方API完全相同——开发者只需把Base URL和API Key替换为Ollama的版本,无需修改任何代码逻辑,所有基于OpenAI SDK构建的应用都能直接切换过来。这一设计大幅降低了迁移门槛,也是Claude Code、Cursor等编程工具能够直接接入的技术前提。
对中国用户特别友好的时区红利
有一个对国内用户格外友好的细节值得关注:官方的Peak时段是UTC 12点到18点、工作日生效,部分模型在这个时段价格翻倍。

换算成北京时间,正好是半夜到凌晨。也就是说,中国用户的使用高峰和美国的高峰完全错开。白天使用Ollama Cloud,速度反而更快、更稳定,因为那几个小时美国的GPU相对闲置。同样的订阅,中国用户能买到体验最好的时段,这是地理上的天然红利。
总结:谁适合Ollama Cloud
Ollama Cloud的定位很清晰:给习惯用Ollama的人一个不用折腾GPU的选项。模型选择多、隐私政策干净、官方承诺不记录不训练数据,再加上对中国用户友好的时区错位,构成了它的差异化优势。
如果你本来就在用Ollama,或者想用更便宜的价钱跑DeepSeek和GLM,不妨先用Free套餐试一试。需要提醒的是,本文数据主要来自单一UP主的实测,实际用量和价格请以官方最新政策为准。
相关推荐

AI递归自我改进RSI:距离真正实现还有多远?
RSI递归自我改进距离真正实现还有多远?本文解析Acer AI的RSI Agent经验积累流程、Shotcut去水印任务实测、OS World 20评测结果,以及OpenAI自动化研究员目标,剖析AI自我改进的现状与关键瓶颈。

三位AI研究者激辩:递归自我改进离我们还有多远?
三位AI研究者(含前OpenAI联合创始人John Schulman)深度辩论递归自我改进与智能爆炸的距离,拆解持续学习瓶颈、蒸馏对抗中心化、RL成功之谜及ASI时间线预测。

AI编程平台爆火:不懂技术也能做出赚钱产品?
一场AI编程竞赛意外吸引1000多人报名,创作者主张不懂技术的人也能用AI coding做出赚钱产品。本文解析AI编程平台的商业化逻辑、行业智能体机会,并理性探讨"程序员要出局"这一激进观点。