#本地部署
共 242 篇相关文章

从1块3090到20台DGX Spark:本地大模型玩家的硬件进化史
一位Reddit用户记录了从单块RTX 3090到20台NVIDIA DGX Spark的本地大模型部署进化史,涵盖MoE内存卸载、多卡功耗瓶颈、保险丝跳闸,以及如何在家用集群上跑通Kimi K3等万亿参数开源模型。

RTX 4090 跑 125B 大模型:Qwen3 Next 实现 100 T/s 推理
开发者在单张 RTX 4090 消费级显卡上运行 125B 参数的 Qwen3 Next Flash 模型,实现约 100 tokens/s 推理速度。本文解析 MoE 架构、量化技术如何让千亿大模型落地消费级硬件。

6GB跑27B大模型?Bonsai 2三值量化的真相与局限
Prism ML的Bonsai 2号称6GB显存保留Qwen3-27B 98%性能。实测显示短任务确实打平,但长链agentic构建全线崩溃。本文剖析三值量化原理与压缩技术的真实局限。

Bonsai 2实测:27B模型压进6GB,98%性能是真的吗?
Bonsai 2将Qwen 27B模型三值量化压缩进6GB文件,可在MacBook本地运行,宣称保留98%性能。实测显示它在聊天问答中表现优秀,但在长程agentic任务中会陷入重复循环无法完成,本文解析其适用边界。

本地跑AI模型该买什么硬件?显存与带宽决定一切
本地跑AI大模型该选Mac还是PC?本文用真实跑分解析决定性能的两大参数——内存容量与带宽,给出速度预测公式,并提供从300美元到数万美元的全预算硬件选购指南。

Ollama v0.34.4 发布:结构化输出提速,Apple Silicon 优化加强
Ollama v0.34.4 正式发布,带来思考型模型结构化输出单次处理提速、修复大型模型库 model not found 及 macOS 无响应问题,并针对 Apple Silicon 优化 Qwen 和 Gemma 性能,同步更新 llama.cpp、MLX 等底层依赖。

Ollama v0.35.1-rc0 更新:模型能力声明机制详解
Ollama 发布 v0.35.1-rc0 预览版,通过 PR #18708 引入显式模型能力声明机制,用 CAPABILITY 字段替代脆弱的架构元数据匹配,并为 MLX 运行时支持铺路。本文解析本次更新的核心变化与工程意义。

Ollama v0.35.1发布:引入Clef决策模型与多模态能力
Ollama v0.35.1 版本发布,新增对 Cloudflare 开源决策模型 Clef 与 Clef Flash 的支持,带来多模态判断能力、CAPABILITY 能力声明机制及网络搜索增强,助力本地 AI 应用开发。

Ollama 发布 v0.35.1-rc2:本地大模型运行工具的持续迭代
开源本地大模型工具 Ollama 发布 v0.35.1-rc2 候选版本,本次更新修复了 CI 构建上下文缺失问题,并通过 GitHub 验证签名。本文解读该版本改动及 Ollama 的社区价值。

48GB MacBook本地实测:11类前沿开源AI模型能力全景
在一台48GB MacBook Pro(M5 Max)上实测11类前沿开源AI模型:大语言、Agent、生成、视觉、3D、视频、世界模型、机器人、医疗、安全与领域基础模型。详解各方向能力边界、实测数据与真实案例,帮你判断本地部署的可行性。

过拟合推理引擎崛起:专用化如何重塑AI本地部署
一批名为Strata、ninfer、DwarfStar的"过拟合推理引擎"正在崛起,它们放弃通用性、专注单一硬件与模型的极致性能优化。本文解析这类专用推理运行时的技术逻辑、价值主张及其对AI本地部署民主化的意义。

8GB显存本地跑大模型:低配玩家的模型选择指南
8GB显存加16GB内存能否流畅运行本地大模型?本文从r/LocalLLaMA社区热帖出发,解析低配硬件下的模型选择、QAT量化技术与MoE架构,为入门级本地AI玩家提供实用参考。

Qwen3 27B + DeepSeek Harness:本地AI告别前沿大模型
实测新版 Qwen3 27B 模型升级与 DeepSeek Harness 工具框架组合:模型进步明显但未到质变,工具框架带来「DeepSeek 时刻」,让本地 AI 彻底摆脱对云端前沿大模型的依赖。附量化精度与显存带宽选购建议。

Ollama本地部署大模型教程:6G显存也能跑的保姆级指南
基于B站实操教程,详解如何用Ollama在本地部署大模型,6G显存也能跑。澄清DeepSeek本地部署真相,附按显存选模型指南与完整安装步骤。

B站开源Index-Translate实测:150语言本地部署,企业级翻译终于能用了
B站开源Index-Translate翻译模型实测:基于千问后训练,支持150种语言、2B/9B/35B三个版本,原生JSON输出、数字术语处理、本地部署,9B版本翻译质量超越谷歌翻译,专为企业级工程落地设计。

ODS本地AI服务器搭建指南:一站运行聊天、图像与视频模型
ODS(OSMantic)本地AI服务器搭建教程:基于Docker一站式部署,运行开源聊天模型、ComfyUI图像视频生成、Perplexer深度研究与语音功能,数据完全私有、无需订阅费。附安装步骤与硬件要求解析。

本地部署MiniMax开源视频模型:懒猫算力舱一键方案实测
本文实测演示通过懒猫模型商店与雷神T5000算力舱一键部署MiniMax开源视频模型的方案,涵盖640P快速出片与1344P高清生成效果、软件与算力分层架构,以及只付电费的本地化成本模型,适合AI短视频与漫剧创作者参考。

B站开源Index-Translate翻译模型:家用电脑本地部署全教程
Bilibili 开源 Index-Translate 翻译模型,支持 150 种语言,2B 版本仅需约 2GB 显存即可本地运行。本文详解如何通过 LM Studio 部署并接入沉浸式翻译,附实测效果与配置步骤。

