#本地部署
共 242 篇相关文章

DeepSeek+RAGFlow本地部署个人知识库完整教程
详解如何用 Ollama 本地部署 DeepSeek 大模型,并通过 Docker 部署 RAGFlow 构建个人知识库。涵盖 RAG 技术原理、Embedding 作用、环境变量配置、完整部署三步流程及在线模型简化方案,小白也能上手。

Ollama 是什么?本地部署开源大模型的入门指南
Ollama 是一个开源免费的大语言模型管理平台,支持在 macOS、Windows、Linux、Docker 上本地部署 DeepSeek 等开源模型。本文讲解 Ollama 是什么、如何降低部署门槛、CPU/GPU 混合利用及私有知识库等应用场景。

NVIDIA DGX Spark 实战:Ollama 本地模型部署与对接教程
NVIDIA DGX Spark 实战教程:手把手教你安装 Ollama、下载本地大模型(如通义千问 3.5 9B),并对接自动化工具执行任务。含 -V1 接口配置等关键避坑细节。

Ollama + Chatbox 教程:把大模型装进自己的电脑
手把手教你用 Ollama 部署本地大模型,再用 Chatbox 套上图形聊天界面。从环境安装、模型筛选到本地对话全流程详解,让 AI 完全跑在自己的电脑上,兼顾隐私与零成本。

本地模型别乱下:用llmfit先筛后测的完整流程
本地大模型选型难?llmfit(LMF8)1.1.15 版把盲选变成先筛后测:读取硬件、按真实任务筛出三个候选、反向规划硬件缺口、再用真实代码任务实测速度与准确率。附与 Ollama、LM Studio 的配合建议。

Ollama本地部署大模型全攻略:零成本实现Token自由
Ollama本地部署大模型完整教程:从安装、模型选型到OpenAI API调用一次讲清。零成本、数据不外传、离线可用,Windows/Mac/Linux全平台支持,附新手避坑指南。

白嫖Kaggle 32GB显存GPU:免费运行本地AI模型全教程
手把手教你白嫖Kaggle的双T4 GPU(32GB显存),通过Ollama部署本地AI模型,再用Cloudflare隧道打通外网,接入Hermes Agent等客户端。完全免费,每周30小时额度,适合无高端显卡用户体验本地大模型。

Ollama 入门指南:本地部署开源大模型的利器
Ollama 是一款免费开源的本地大模型管理工具,支持将 DeepSeek 等开源模型部署到本地。本文介绍 Ollama 是什么、跨平台特性、CPU/GPU 支持及本地部署的应用场景,适合零基础入门 AI 大模型开发。

LM Studio、Ollama、vLLM深度对比:本地大模型部署工具怎么选
LM Studio、Ollama、vLLM三款本地大模型部署工具深度对比。从上手难度、适用场景到性能表现全面解析:小白选LM Studio,开发者用Ollama,企业级高并发上vLLM,帮你快速选对工具。

Ollama入门:本地部署开源大模型的核心工具解析
本文详解 Ollama 是什么及其核心价值:作为一款开源免费的大模型管理工具,它能将 DeepSeek 等开源模型部署到本地,支持 GPU/CPU 灵活调度、跨平台运行,并提供 API 与命令行接口,适合搭建私有知识库等场景。

Mac Studio本地实测DeepSeek V4.1 Flash:本地大模型能跑多远
在Mac Studio M3 Ultra上本地实测DeepSeek V4.1 Flash:550亿参数、N-gram机制、思考模式取舍与Deep SWE基准全解析,探讨本地大模型的能力边界与瓶颈。

HF热榜盘点:DeepSeek-V4.1-Flash登顶,端侧与本地部署全面爆发
Hugging Face真实热榜盘点:DeepSeek-V4.1-Flash以552B MoE多模态旗舰登顶,MiniCPM5 2B抢占端侧,Qwen3.8 27B GGUF量化版成本地部署首选,解析开源模型三大趋势。

Qwen3.8 27B 本地实测:性能碾压旗舰,配置才是关键
海外博主深度实测 Qwen3.8 27B 本地部署:Artificial Analysis 跑分达 52 分紧追 GLM 5.2。文章详解 FP8、NVFP4 量化版本选择、推理档位设置及 vLLM 与 SGLang 引擎速度对比,SGLang 可达约 200 tokens/秒。

MiniMax H3 开源视频模型本地部署实测:8G显存即可玩转
MiniMax H3 最新开源视频生成模型本地部署实测教程,支持文生视频、图生视频与首尾帧控制。8G显存即可运行,含ComfyUI部署流程、量化版本选择与实际应用效果分析。

LTX2.5开源本地部署实测:AMD显卡最低8G显存跑视频生成
开源视频生成模型 LTX2.5 本地部署实测:AMD 7900XTX 显卡在 Windows 11 环境下最低 8G 显存可运行,2 分钟生成 5 秒视频。附五套工作流对比与整合包、手动部署教程。

16G显存跑Qwen3 27B:192K上下文+视觉实测
在16G显存显卡上部署Qwen3 27B模型,通过llama.cpp Adaptive KV Streaming实现192K超长上下文与视觉能力。本文详解KV缓存瓶颈原理、量化版本选择及RTX 5080实测速度与任务能力。

MiniMax H3本地部署实测:开源视频模型效果与完整教程
MiniMax H3 开源视频模型本地部署实测:涵盖硬件要求、ComfyUI 完整部署教程,以及文生视频、图生视频的真实生成效果与耗时,适合想入门本地 AI 视频生成的用户参考。

用GPT和Grok搓出本地AI视频生成器,真能跑起来吗?
海外博主纯靠 GPT、Grok 和 Cursor,不写专业代码从零搭建本地 AI 视频生成应用,最终真的跑通了「威尔·史密斯吃意面」测试。本文拆解其构建全过程、14B 模型带来的质变,以及本地部署的现实门槛。

MiniMax H3本地部署教程:8G显存跑通开源视频模型
详解MiniMax H3开源视频模型本地部署工作流:从三图输入、参数化时长控制到Clip/UNet/VAE模型加载,重点讲解8G显存优化的lowvram、分块处理与内存节约三大节点,附ComfyUI采样合成完整链路。

8卡2080Ti 22G本地部署GLM-5.3-Flash实测:TP2 PP4并行方案解析
8卡2080Ti 22G本地部署GLM-5.3-Flash实测:通过TP2 PP4混合并行方案,短文本达30tok/s,33K长文解码18tok/s、预填充180tok/s。深度解析多卡推理的并行策略与推测解码适用性。