NVIDIA DGX Spark 实战:Ollama 本地模型部署与对接教程

在 DGX Spark 上通过 Ollama 部署本地大模型并对接自动化工具的完整操作指南。
本文整理自一期 B 站实战演示,详细拆解了在 NVIDIA DGX Spark 上安装 Ollama、下载并启动本地大模型(以 qwen3.5:9b 和 31B 模型为例),以及将其对接到自动化工具的完整流程。整体操作与 Windows/macOS 高度一致,但有两个关键细节需要特别注意:一是对接工具时接口地址必须加上 `/v1` 后缀,否则请求无法正常响应;二是本地推理场景下建议关闭多余的推理模式以缩短等待时间。消息通道和 Web 搜索引擎均为可选配置,纯本地任务可跳过。完成配置后,通过访问本地地址 `127.0.0.1:18789` 即可进入可视化界面,整套流程将 DGX Spark 变为一台数据不出本地的 AI 工作站。
在 NVIDIA DGX Spark 这台小主机上跑本地大模型,是不少 AI 爱好者关注的话题。本文根据一期 B 站实战演示视频整理,完整拆解如何在 DGX Spark 上部署 Ollama、加载本地模型,并将其对接到自动化工具中执行任务。整个流程与在 Windows、macOS 上的操作逻辑基本一致,但也有几个容易踩坑的关键细节值得留意。
Ollama 的安装准备
DGX Spark 的桌面上通常会预置两个说明文件,双击其中的文档即可跳转到官方网站。往下翻页可以找到 Ollama 的安装命令,复制到终端粘贴执行,等待安装完成即可。
这一步没有太多复杂配置,Ollama 本身就是为简化本地大模型部署而设计的。安装完成后,它会在后台以服务形式运行,为后续的模型下载和调用提供接口支持。对于第一次接触本地部署的用户来说,这种一条命令搞定的方式大幅降低了门槛。
Ollama 是一个开源的本地大语言模型运行框架,核心目标是让用户无需深入了解 CUDA、模型权重格式等底层细节,就能在本地机器上拉取并运行主流开源大模型。它内置了模型仓库(类似 Docker Hub 的设计理念),通过 ollama pull 或 ollama run 命令即可自动下载量化后的模型文件(通常为 GGUF 格式)。运行时,Ollama 在本地启动一个 HTTP 服务(默认监听 11434 端口),对外暴露兼容 OpenAI API 格式的接口,这也是各类自动化工具能够方便对接它的原因。量化技术(如 Q4、Q8)使得原本需要数十 GB 显存的模型得以在消费级或小型专业硬件上运行,代价是精度的少量损失。
下载与启动本地模型
打开浏览器进入 Ollama 官网,点击 Models 就能看到所有可下载的模型列表。演示中作者选择了两个模型:一个是 31B 规模的模型,另一个是通义千问 3.5 的 9B 版本。

安装模型的命令非常直观,直接在终端输入 ollama run qwen3.5:9b 即可,Ollama 会自动下载对应模型文件,下载完成后自动将模型启动起来。模型规模的选择需要结合 DGX Spark 的显存和算力来权衡——9B 级别的模型在这类小主机上运行相对流畅,而 31B 模型则对硬件要求更高。
作者特别提醒:在对接工具使用这个模型时,建议关闭“四个模式”(即部分推理相关的功能选项),否则任务响应会等待很长时间。这是本地推理场景下平衡速度与效果的一个实用经验。
模型规模(参数量)与所需显存之间存在直接关联。以常见的 Q4 量化精度为参考:7B–9B 模型约需 5–6 GB 显存,31B 模型约需 18–20 GB 显存,70B 模型则通常需要 40 GB 以上。NVIDIA DGX Spark 搭载 GB10 Grace Blackwell 超级芯片,配备 128 GB 统一内存,GPU 部分可调用其中相当大的份额,这使得在单机上运行 31B 乃至更大规模的模型成为可能。选择模型时,除显存外还需考虑推理速度(tokens/s):参数越多,单次推理延迟越高,在需要多轮交互的自动化任务场景下感受尤为明显,这也是作者建议关闭额外推理模式以降低延迟的背景原因。
对接自动化工具的关键配置
模型启动后,就可以在自动化工具的配置中选择 Ollama 作为后端。这里有一个非常关键的细节:在配置 Ollama 接口地址时,建议在末尾加上 -V1(即使用 v1 版本的 API 端点)。

作者强调,如果不加这个 -V1,工具在调用模型时很可能出现一直转圈、不返回结果的情况。这是因为 Ollama 的兼容接口路径需要明确指向 v1 版本,很多对接失败的问题都出在这里。加上之后回车,工具会自动识别本地已安装的模型。
配置模型来源时,选择“本地模型”即可。由于作者此前已经安装了 qwen3.5 和 31B 两个模型,工具会直接识别到它们。选择 qwen3.5 的 9B 模型后回车,配置就会自动写入配置文件,完成后即可直接调用。
这里的 /v1 路径源于 OpenAI API 的设计规范——OpenAI 的官方接口地址形如 https://api.openai.com/v1/chat/completions,众多第三方工具默认按照这一路径格式发送请求。Ollama 同时维护着两套接口:原生的 /api/ 路径(Ollama 自有格式)和兼容 OpenAI 的 /v1/ 路径。当自动化工具以 OpenAI 兼容模式对接 Ollama 时,若配置的 Base URL 未显式包含 /v1,工具发出的请求会落到不匹配的路径上,导致服务端无法解析而陷入等待。因此,正确的本地地址通常写作 http://127.0.0.1:11434/v1,而非仅填写主机和端口号。
通道与搜索引擎的可选配置
对接过程中,工具还会提示配置消息通道,比如飞书、企业微信、钉钉等,用于任务结果的推送。演示中作者选择直接跳过这些步骤。

接下来是搜索引擎配置环节,工具支持接入 Web 搜索引擎。Ollama 官方也提供了网络搜索能力,但需要配置对应的 API Key。获取方式是打开 Ollama 官网,注册一个账号后在相关页面获取 API Key。对于只想跑本地任务、不需要联网检索的场景,这一步同样可以跳过。
后续还会询问是否需要配置其他扩展项,演示中作者都选择了跳过。全部跳过之后,工具的前期配置就基本完成了,此时 Ollama 服务和本地模型都已经启动就绪。
运行任务与验证
配置完成后,运行工具并让其加载配置文件(通过 Gateway 相关命令)。当提示配置文件已成功加载后,打开浏览器访问本地地址 127.0.0.1:18789,即可进入工具的可视化操作界面。

在界面中选择 qwen3.5 的 9B 模型,就可以让它开始执行任务了。到这一步,从工具安装到 Ollama 部署再到模型对接的完整流程就全部走通。整体来看,DGX Spark 上的本地部署体验与主流桌面系统高度一致,真正的差异点在于硬件算力带来的模型规模上限,以及 -V1 这类接口细节。
小结
这套流程的价值在于把 DGX Spark 从一台硬件设备变成了可用的本地 AI 工作站。对于希望数据不出本地、又想要一定推理性能的用户,Ollama + 本地模型 + 自动化工具的组合提供了一条清晰路径。实操中最需要记住的两个要点是:对接接口务必加 -V1,以及根据主机性能合理选择模型规模和关闭不必要的推理模式。
相关推荐

一个月为M4 Mac Mini开发Linux GPU驱动的技术挑战
开发者Cody Ho用一个月时间为M4 Mac Mini构建Linux GPU驱动,本文解析Apple Silicon GPU逆向工程的核心难点、开源社区协作价值及其对Linux硬件生态的意义。

SEO Page Builder Enhanced:让AI生成的SEO内容摆脱套路味
开发者基于octelens原版seo-page-builder打造的增强版开源工具,通过引入编辑审校、一手经验、事实与时效校验及写作风格护栏,专门解决AI生成SEO内容套路化、缺乏原创洞见的问题。

分层RAG架构研究求助:独立开发者如何叩开学术研究之门
一位独立开发者在Reddit求助信息检索领域教授,指导其分层RAG架构研究。本文剖析异构文档检索的技术背景,探讨独立AI研究者面临的学术门槛困境,并给出公开成果、社区协作等实用建议。