Ollama
Ollama 是一款开源的本地大语言模型运行框架,允许用户在个人计算机上部署和运行多种大型语言模型,无需依赖云端服务。它提供命令行界面与 REST API,支持 Llama、Mistral 等主流开源模型,并通过简洁的模型管理机制实现模型的下载、切换与运行,适用于开发者进行本地推理、调试与应用集成。
核心事实
时间轴 (近 90 天)
截至2025年,Ollama已积累超过百万月活跃用户,支持的模型格式从GGUF扩展到SafeTensors等多种格式
Ollama引入了类似Dockerfile的Modelfile概念,允许用户自定义系统提示词、温度参数和上下文窗口大小等配置
对于推理量不稳定的中小企业和独立开发者,Ollama云端按需付费方案经济优势明显;而日均调用量超过阈值的大型企业自建推理集群单次成本可能更低
Ollama是一个专注于大语言模型本地化和云端部署的开源工具平台,底层技术栈主要依托由Georgi Gerganov开发的llama.cpp推理引擎
Ollama云端GLM服务器分布在美国和欧洲
Ollama云端部署的GLM 5.3系列主打私密性、高速响应以及零数据留存三大特性
标准版GLM 5.3可通过命令ollama launch claude --model glm-5.3:cloud部署,GLM 5.3 Flash通过ollama launch opencode --model glm-5.3-flash:cloud启动
Ollama托管的DeepSeek模型采用零数据留存(ZDR)政策
DeepSeek-V4-Flash和DeepSeek-V4-Pro在工作日UTC时间12:00至18:00之外的时段以及周末全天价格下调50%
Ollama托管的DeepSeek模型部署在美国和欧洲的数据中心
还有 40 条时间轴事件
全部知识事实 (20)
Ollama将本地模型部署简化为一条命令行指令,并提供与OpenAI兼容的本地API接口
80%已验证Open WebUI 支持 Ollama 和 OpenAI API 等多种后端
80%已验证Ollama底层基于llama.cpp的推理引擎,原生支持GGUF格式的量化模型
80%已验证Ollama支持Llama 3、Mistral、Gemma、Qwen等主流开源模型
80%已验证Spring AI支持OpenAI、Anthropic、Ollama等多种模型提供商,提供统一的API抽象层
80%已验证Ollama是一款开源的本地大模型运行框架,支持在个人电脑上一键部署各种开源大语言模型
80%已验证Spring AI 通过定义统一的 ChatModel、EmbeddingModel 等核心抽象接口,让上层业务代码与具体模型实现解耦
80%已验证Ollama支持macOS、Linux、Windows跨平台运行
80%已验证Ollama内置了与OpenAI兼容的REST API,默认端口为11434
80%已验证Ollama提供类似Docker的一键式模型管理体验,vLLM通过PagedAttention实现高吞吐量批量推理,LM Studio面向桌面用户提供图形化界面
75%已验证推理框架如 vLLM、llama.cpp、TGI 可用于开放权重模型的本地部署
75%已验证GGUF 已成为 llama.cpp、Ollama、LM Studio 等主流本地推理工具的事实标准格式
75%已验证Ollama提供标准API接口,支持Python、Java、Rust等多种编程语言调用
75%已验证Ollama本身完全免费且开源
75%已验证Ollama基于llama.cpp项目构建,后者由Georgi Gerganov开发
70%已验证Ollama安装后默认监听地址为localhost:11434
70%已验证本地部署大模型的最大意义在于数据不出域,敏感日志、告警和内部信息不会上传至第三方
65%已验证Ollama在llama.cpp之上封装了模型管理和REST API接口层,用户只需ollama pull一条命令即可完成模型下载与运行环境配置
65%已验证Ollama 本质上是一个封装了 llama.cpp 推理引擎的本地模型服务器
65%已验证Ollama于2023年推出,是一个本地大型模型运行框架,支持一键部署各种开源模型
65%