#本地大模型
共 42 篇相关文章

Ollama实战教程:免费本地运行AI大模型全流程
Ollama完整使用教程:教你在macOS、Windows、Linux上免费安装并本地运行开源AI大模型,详解本地模型与云端模型区别、定价免费额度,以及与Claude Code集成的实操步骤。

Ollama+OpenWebUI 私有化部署:打造团队专属ChatGPT替代方案
详解如何用 Ollama + OpenWebUI 实现 ChatGPT 私有化替代方案,涵盖本地大模型部署、团队多用户协作、节点管理与权限控制,帮助企业和个人把AI算力彻底私有化、摆脱大厂订阅费。

本地大模型崛起:Qwen-Next对决Sonnet 5.5的社区实测观察
Reddit 社区实测将开源模型 Qwen-Next 3.8/27B 与 Sonnet 5.5 对比,开发者认为本地模型已站上前沿。本文解读本地大模型崛起的意义、真实优势与理性看待方式。

同一个本地AI为何在不同电脑上体验天差地别?
为什么同一个本地AI模型在不同电脑上体验天差地别?本文深度解析显存陷阱、量化、统一内存、上下文占用等关键变量,并对比Qwen、Gemma、DeepSeek等模型及Ollama、LM Studio等工具,教你按硬件和任务选出真正合适的本地大模型。

AI工作流最致命陷阱:假JSON为何还能返回成功?
AI工作流中最隐蔽的陷阱:模型返回「几乎合法」的假JSON却报告成功,导致工作流三步之后崩溃。本文拆解模型与代码的失败本质区别、四类适合模型的任务、三层JSON防御机制,以及书签管理、配置审查、运行手册三个本地模型实战案例。

Ling Tiny 3.0:8B小模型让2017年老笔记本跑出智能
阿里 Ling 3.0 Tiny 是一个 8B 参数、仅 1B 激活的 MoE 模型。一位 Reddit 用户在 2017 年老笔记本上用纯 CPU 跑出 10 tokens/秒,完成多轮编程任务,展示了边缘智能的全新可能。

Mac 本地运行大模型指南:内存、模型与工具怎么选
在 Mac 上运行本地大模型(Local LLM)完全指南:如何根据内存选择合适的模型规模、Ollama 与 LM Studio 等免费开源工具对比,以及为什么大模型不一定是最优解。帮你用最合理的投入部署本地 AI。

M5 Ultra 80核跑GLM-5.3-Flash实测:内存充裕但GPU成瓶颈
Reddit 用户实测 M5 Ultra 256GB 80核 Mac Studio 运行 GLM-5.3-Flash 的本地大模型表现:内存充裕但 GPU 算力成为明显瓶颈,并探讨 512GB 机型是否值得为 AI 推理买单。

M6 Mac mini对决M5 Ultra Mac Studio:本地AI实测全解析
iJustine实测M6 Mac mini与M5 Ultra Mac Studio的本地AI性能:从Nemotron聊天机器人、Blender渲染到Flux绘图,再到105GB的Quen大模型运行。谁才是本地AI的最佳选择?

Mac M5 Ultra 256GB本地大模型跑分之谜:社区为何呼吁严肃测试
Mac M5 Ultra 256GB上市后,本地大模型社区呼吁严肃跑分测试。为何8B小模型无法体现256GB大内存优势?苹果统一内存能否挑战Nvidia的GPU工作流?本文剖析高端AI硬件评测的现实困境。

M5 Ultra Mac Studio评测:本地AI工作站的性能跃迁
凰家评测实测M5 Ultra Mac Studio:CPU多核提升68%、GPU光追翻倍,256GB大内存可本地运行DeepSeek 284B量化模型,成为隐私安全的本地AI工作站。附Mac Studio与Mac Mini选购建议。

M5 Ultra Mac Studio硬刚RTX 5090:谁才是性能王者?
海外博主实测M5 Ultra Mac Studio对比RTX 5090顶级PC:多核CPU翻倍领先且更省电,700亿参数AI模型推理快20倍,视频剪辑各有胜负,游戏仍是PC天下。统一内存架构成本地AI开发关键优势。

M5 Ultra真机实测:AI推理提速最高4倍,代价几何?
M5 Ultra对比M3 Ultra真机实测:token生成提速1.5倍,prompt processing最高达4.2倍,内存带宽实测超1TB/s。但功耗飙至400W、噪音温度上升。谁值得购买?

RTX Pro 6000 vs M5 Ultra:十几万AI工作站怎么选
十几万预算的个人AI工作站,RTX Pro 6000和Mac Studio M5 Ultra怎么选?本文从显存容量、算力吞吐、视频生成、功耗成本等维度深度对比,帮你根据实际负载做出选择。

本地27B AI Agent自主完成亚马逊购物:一次跑通全流程
一位开发者用本地运行的Qwen3 27B模型加TensorSharp运行时,让AI Agent自主完成亚马逊购买A4纸的全流程。推理、决策、代码生成全部本地化,仅登录和付款人工干预。本文拆解其技术栈与本地浏览器Agent的价值和局限。

本地跑AI模型不等于安全:警惕成为黑客入侵入口
本地运行AI模型真的安全吗?海外博主警告下载错误的开源模型或运行器可能成为黑客入侵入口。本文解析开放权重与开源模型的区别、llama.cpp的Llama Drama漏洞,以及沙盒隔离与云端部署等安全实践。

16GB显存是多数人的天花板:本地大模型的现实与未来
为什么16GB甚至12GB显存才是多数人跑本地大模型的现实上限?本文解析小显存下的AI能力现状——量化模型让agentic编程成为可能,同时探讨世界知识的硬性限制与超越Transformer架构的未来方向。

Ollama入门指南:让本地电脑轻松运行大模型
Ollama 让大模型在本地电脑离线运行,无需联网、免费无 token。本文详解 Ollama 的安装、命令行与 Web UI 使用、模型下载与管理方法,以及运行大模型的硬件要求。

普通家用电脑跑本地大模型实测:哪些值得留下?
普通家用电脑能跑动哪些本地大语言模型?B站UP主用 Geekom mini 主机实测 Gemma、GPT-OSS、Qwen3 等多款模型的 Token 生成速度,最终筛选出 Qwen3 27B 与 Gemma 26B 两款值得日常使用的模型,并总结 MoE 架构与显存分配的关键作用。

低显存本地大模型对决:Bonsai 2量化版为何胜出
Reddit 用户在 RTX 5090 上横评 Bonsai 2 27B、Gemma 4 12B 与 Qwen 3.5 9B。基于三元量化的 Bonsai 用 7.2GB 显存实现更优的日式体素宝塔渲染效果,展现低显存本地大模型的量化新趋势。