[控场AI]

#本地部署

共 242 篇相关文章

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨
·5 分钟

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨

一场Reddit讨论探讨了无GPU本地部署大模型的可行性:用老旧DDR3多路服务器靠内存带宽跑Qwen 3.8 Flash,以及4bit量化、KV缓存与上下文长度的实用权衡与电费成本争议。

阅读全文 →
本地跑AI编程模型全攻略:Ollama+VS Code+Cline实战
·7 分钟

本地跑AI编程模型全攻略:Ollama+VS Code+Cline实战

手把手教你用 Ollama + VS Code + Cline 在本地电脑免费运行 AI 编程模型。涵盖按显存选模型、SWE-bench 跑分对比、MCP 配置及无审查模型玩法,零成本、零 Token 限制、完全私密。

阅读全文 →
Mac 本地跑 AI 完整教程:Ollama 安装与模型选择指南
·7 分钟

Mac 本地跑 AI 完整教程:Ollama 安装与模型选择指南

手把手教你在 Mac 上免费运行本地 AI 模型:Ollama 引擎安装、终端运行 DeepSeek,以及用 Docker + Open WebUI 搭建 ChatGPT 式界面,附不同内存机型的模型选择建议。

阅读全文 →
本地大模型部署入门:Ollama与vLLM部署qwen3实战解析
·5 分钟

本地大模型部署入门:Ollama与vLLM部署qwen3实战解析

本地大模型部署入门教程:解析Ollama与vLLM两大部署工具的核心差异,梳理显存平衡、高并发、服务化等部署目标,并介绍如何用vLLM部署qwen3-0.6B模型。

阅读全文 →
用C++和NVIDIA TensorRT RTX构建本地AI应用实战指南
·4 分钟

用C++和NVIDIA TensorRT RTX构建本地AI应用实战指南

NVIDIA推出TensorRT RTX示例项目,帮助开发者用C++构建高性能本地AI应用。本文解析本地推理的核心挑战、可移植模型格式、跨系统GPU加速方案及Do Inference Now样例的实践价值。

阅读全文 →
llama.cpp 合并 MTP 支持:Qwen Flash Next 推理加速实测
·4 分钟

llama.cpp 合并 MTP 支持:Qwen Flash Next 推理加速实测

llama.cpp 合并 PR #29761,为 Qwen Flash Next 添加 MTP 多 token 预测支持,开发者 am17an 耗时 17 小时完成。本文解析 MTP 加速原理、GGUF 量化部署及对本地大模型用户的意义。

阅读全文 →
Ollama本地决策模型来了:Nimble如何实现实时任务路由
·4 分钟

Ollama本地决策模型来了:Nimble如何实现实时任务路由

Ollama宣布支持本地运行的决策模型,并推出Nimble模型与全新/v1/systemone API,可用于工单分流、模型路由和内容审核等实时决策任务。本文解析其功能、应用场景与落地价值。

阅读全文 →
4张Tesla T4组建64GB本地AI推理主机实战解析
·5 分钟

4张Tesla T4组建64GB本地AI推理主机实战解析

一位Reddit用户分享用4张Tesla T4显卡(共64GB显存)搭建本地AI推理主机的完整配置,涵盖硬件选型、llama.cpp+OpenWebUI软件栈,以及CPU并非推理瓶颈的实测经验。

阅读全文 →
本地跑AI每小时0.12欧,调用前沿模型API反而更划算?
·5 分钟

本地跑AI每小时0.12欧,调用前沿模型API反而更划算?

本地跑大模型每小时电费仅0.12欧,是否意味着直接调用前沿模型API反而更贵?本文拆解每小时成本与每百万token成本的换算误区,分析硬件折旧、速度与质量等隐性成本,帮你算清本地推理与云端API的真实性价比。

阅读全文 →
一条命令搭建本地AI服务器:ODS开源部署LLM/RAG/绘图全攻略
·7 分钟

一条命令搭建本地AI服务器:ODS开源部署LLM/RAG/绘图全攻略

ODS(Osmatic部署系统)是一个Apache 2.0开源项目,一条命令即可在本地部署LLM推理、RAG、图像生成、语音智能体等完整AI技术栈,支持Linux/Windows/macOS。本文解析其功能、端口约定、可信度与实操建议。

阅读全文 →
8G显存本地跑125B大模型:Qwen3.8-Flash-Next部署实测
·6 分钟

8G显存本地跑125B大模型:Qwen3.8-Flash-Next部署实测

零度解说实测开源项目在8G显存消费级显卡上本地运行125B参数的Qwen3.8-Flash-Next大模型,N卡A卡通用。涵盖量化部署流程、代码生成、多模态识别与Agent应用全过程。

阅读全文 →
带模型商店的AI硬件:本地大模型部署真能零门槛?
·4 分钟

带模型商店的AI硬件:本地大模型部署真能零门槛?

一位B站UP主分享带「模型商店」的本地AI硬件算力舱体验:一键部署语音转文字、图像识别、文生图等模型,设备显存与运行状态全透明,探讨本地大模型零门槛部署是否真能实现。

阅读全文 →
AI视频入门第一课:云端还是本地部署?成本速度质量全解析
·7 分钟

AI视频入门第一课:云端还是本地部署?成本速度质量全解析

同一条AI视频云端近100元、本地仅8毛,差距100多倍。本文解析2026年AI视频入门第一道选择题:云端还是本地部署,从成本、速度、质量三方面全面对比,附主流模型天梯图与新手/个人/团队选择建议。

阅读全文 →
Ollama入门指南:零基础本地部署开源大模型
·5 分钟

Ollama入门指南:零基础本地部署开源大模型

Ollama 是一款开源免费的本地大模型管理工具,支持 Windows、Mac、Linux 和 Docker,可自动调度 GPU/CPU 资源,轻松部署 DeepSeek 等开源模型。本文带你零基础了解 Ollama 的核心功能与特点。

阅读全文 →
DeepSeek+Ollama+AnythingLLM本地RAG知识库部署全攻略
·8 分钟

DeepSeek+Ollama+AnythingLLM本地RAG知识库部署全攻略

手把手教你用Ollama+AnythingLLM+DeepSeek在Ubuntu环境搭建本地私有RAG知识库,详解Docker部署、模型下载、远程访问配置及常见踩坑,打造专属行业大模型。

阅读全文 →
本地开源大模型跑代码实测:Qwen 3.5 够用吗?
·5 分钟

本地开源大模型跑代码实测:Qwen 3.5 够用吗?

海外资深开发者实测本地开源大模型 Qwen 3.5 跑代码:9B 小模型复杂任务翻车、小任务表现不错,397B 云端版本则轻松过关。附 Ollama 与 LM Studio 本地部署要点与显存门槛分析。

阅读全文 →
llama.cpp 新增 GLM-5.3-Flash 支持:本地跑智谱新模型
·4 分钟

llama.cpp 新增 GLM-5.3-Flash 支持:本地跑智谱新模型

开发者 timkhronos 向 llama.cpp 提交 PR #27773,新增对智谱 GLM-5.3-Flash(GLM5-Next)的支持,用户将可在家用电脑本地运行该模型。本文解析这一进展对本地大模型部署的意义。

阅读全文 →
本地AI部署8大误区:参数越大真的越强吗?
·9 分钟

本地AI部署8大误区:参数越大真的越强吗?

本地AI部署的8大常见误区解析:参数越大不等于越强,激活参数≠总参数,高精度未必更好,本地≠隐私,买硬件≠省钱。教你用小型试镜和检索方案在现有电脑上跑通本地大模型工作流。

阅读全文 →