[控场AI]
· 5 分钟阅读· 2,961 字

Ollama实战教程:免费本地运行AI大模型全流程

Ollama实战教程:免费本地运行AI大模型全流程

Ollama让开发者在本地免费运行开源大模型,并可与Claude Code等编程助手无缝集成。

Ollama是一款跨平台工具,支持在macOS、Windows和Linux上本地部署开源大语言模型,也提供云端模型的额度调用。用户安装后可与Claude Code、OpenCode等主流编程助手集成,将原本调用商业API的请求替换为本地或开源云端模型,从而大幅降低使用成本。本地模型方面,用户需根据设备内存选择合适参数规模,从Granite 4.1的3亿轻量版到Qwen3的300亿参数版均有覆盖,下载后永久免费使用;云端模型则提供GLM、DeepSeek Flash、Gemma 3等较新模型,新用户有免费额度,付费版每月约20美元起。整体方案兼顾隐私保护、成本控制与最新模型性能,是本地化AI开发的实用入口。

Ollama是一款让普通用户在本地电脑上运行开源大语言模型的工具。它既支持完全免费的本地部署,也提供云端模型的额度调用,还能与Claude Code、OpenCode等编程助手集成。这篇教程梳理了从安装到实际调用模型的完整流程,适合想在自己机器上跑AI模型、又不想被API费用困扰的开发者参考。

一、安装Ollama:三大平台通吃

Ollama支持macOS、Linux和Windows三大操作系统。访问官方网站 ollama.com,点击下载按钮即可进入下载页面,根据自己的系统选择对应版本。

安装方式有两种:一是直接下载图形化安装程序,双击安装;二是使用命令行脚本。对于Windows用户,可以在PowerShell中粘贴官方提供的安装命令;macOS和Linux用户则可以在终端中执行curl脚本。整个下载和安装过程非常轻量,通常只需几秒钟就能完成,不需要漫长等待。

安装完成后,Ollama就已经在系统中就绪,可以通过终端命令直接调用。

直接复制这个文件夹粘贴到这里

二、与代码编辑器集成

Ollama的一大亮点是能够与多种编程助手工具集成。在项目目录下打开终端,输入ollama命令后,会出现多个启动选项。

按方向键可以看到支持的工具列表,包括Claude Code、OpenCode、Hermes,以及OpenClaw广告、DeepSeek广告 Harness等多种代码代理框架。使用前需要先安装对应的工具。以Claude Code为例,如果尚未安装,需要先前往其官网,按照文档用脚本(macOS/Linux用curl,Windows用PowerShell命令)完成安装。

装好后,就可以用Ollama直接启动Claude Code,并选择本地或云端模型作为后端。这种集成方式让开发者可以用熟悉的编程助手界面,背后却调用完全免费的本地模型。

三、本地模型 vs 云端模型

启动后,Ollama会列出推荐的模型,分为本地模型和云端模型两类。

本地模型

本地模型需要先下载到电脑上,核心考量是硬件内存。教程中提到,Qwen3的300亿参数模型需要约23GB空间,对系统内存要求较高。如果机器配置不够,可以选择更小的模型,比如IBM构建的Granite 4.1系列(含3亿参数的轻量版本)。模型尺寸越大,性能越强,但对硬件的要求也越高——用户需要根据自己的设备和网络情况权衡选择。

下载模型只需复制对应的pull脚本,在终端新建标签页粘贴执行,等待拉取清单和下载完成即可。本地模型最大的优势是永久免费,运行时不产生任何费用。

然后你可以看到

模型参数量是衡量大语言模型规模的核心指标,通俗理解就是模型内部"神经连接"的数量。参数越多,模型捕捉语言规律的能力越强,但占用的存储空间和运行内存也成正比增长。一般而言,30亿参数以下的模型可在8GB内存的普通笔记本上流畅运行;100亿至300亿参数的模型则通常需要16GB至32GB内存,并建议搭配独立显卡或Apple Silicon芯片以获得可接受的推理速度。Granite 4.1的3亿参数版本属于极轻量级,几乎可在任何现代电脑上运行,适合入门体验;而Qwen3的300亿参数版本则面向高配置工作站,能处理更复杂的编程和推理任务。用户在选择模型前,可在终端执行 free -h(Linux)或查看"关于本机→内存"(macOS)确认可用内存。

云端模型

如果想体验最新的大模型,可以使用Ollama Cloud。云端提供GLM、DeepSeek Flash等较新的模型。使用云端模型需要注册并登录Ollama账号。

四、定价与免费额度

在选择云端模型前,建议先了解定价结构。据教程演示,Ollama的定价层级如下:

  • 免费版:运行本地模型永久免费,并包含新用户额度,可每天测试,包含一个入门模型的访问权限。
  • 专业版(Pro):每月约20美元,提供每月60美元的用户额度,解锁所有模型。
  • 更高级套餐:每月约100美元,另有团队套餐和企业套餐可按需选择。

包含新用户额度

登录可以用Ollama账号,也可以直接用Google账号继续。登录后,免费用户额度可用于部分云端模型,包括Gemma 3(约43亿参数)、GPT-OSS(1200亿参数)、Nemotron等。想使用其他更强模型则需要升级付费。

五、实际调用演示

云端模型调用

教程中选择了Gemma 3(43亿参数)云端模型。这款模型定位于智能体工作流和多模态推理。在终端用上下箭头选中后按回车,需要连接Ollama账户授权,并授予对项目目录的访问权限。连接成功后,Claude Code便搭配该云端模型就绪,可以输入指令开始编写代码。

Gemma 3是Google DeepMind发布的开源多模态语言模型系列,43亿参数版本在同等体量的开源模型中具有较强的指令遵循和代码生成能力。"多模态"意味着该模型除文本外还能处理图像输入,适合需要理解截图或设计稿的智能体工作流场景。由于模型权重以开源授权发布,Ollama可将其托管在云端供用户调用,而无需用户自行承担服务器成本,这也是免费额度能够覆盖该模型的原因。对于仅需要文本代码生成的场景,43亿参数版本的响应速度和质量通常已能满足日常编程辅助需求。

本地模型调用

下载好的Granite 4.1本地模型使用起来同样简单。重新启动Claude Code,在模型选项中选择Granite 4.1即可。教程中实测让它"写一个Python代码来相加两个数字",模型成功生成了接收两个数字输入、相加并打印结果的脚本。

关键点在于:使用本地模型完全免费,因为所有计算都在本地完成,不消耗任何云端额度或费用。

总结建议

Ollama为开发者提供了灵活的AI模型运行方案。预算有限或注重隐私的用户,可以选择本地模型,一次下载永久免费使用;追求最新模型性能的用户,则可以利用新用户额度免费体验云端模型,或升级付费套餐。两种模式都能与主流编程助手无缝集成,是本地化AI开发的实用入口。

背景补充

Claude Code是Anthropic推出的命令行式AI编程助手,其设计定位是直接在终端环境中操作代码库,能够读写文件、执行命令、调用外部工具,并在多步骤任务中保持上下文。与传统IDE插件不同,Claude Code以"代理(Agent)"模式工作,可自主规划并完成跨文件的重构、调试或功能开发任务。Ollama与它的集成本质上是替换后端推理引擎:原本调用Anthropic云端API的请求,被重定向到本地或Ollama云端的开源模型,从而在不改变操作界面的前提下实现零成本或低成本运行。OpenCode则是另一款类似定位的开源编程代理,适合不希望依赖商业工具的开发者。

分享:

相关推荐