[控场AI]

#本地部署

共 242 篇相关文章

英伟达Jetson本地跑Qwen3 27B:NVFP4+投机解码实测解析
·4 分钟

英伟达Jetson本地跑Qwen3 27B:NVFP4+投机解码实测解析

英伟达在Jetson平台针对Qwen3 27B稠密模型做本地推理优化,采用NVFP4量化叠加投机解码的最优组合,让高端大模型在边缘设备上从能跑到能用。本文解析其技术原理与本地部署价值。

阅读全文 →
Unsloth 0.1.900 更新:Laya 决策模型与统一媒体库上线
·6 分钟

Unsloth 0.1.900 更新:Laya 决策模型与统一媒体库上线

Unsloth 发布 v0.1.900 版本,新增 Laya 决策模型支持、统一媒体库与文档查看器,图像视频生成提速约 4.5 倍,并带来大量 Apple Silicon 与训练推理优化。

阅读全文 →
Qwen3 Flash Next本地实测:142 tokens/s的私有编程助手怎么搭
·8 分钟

Qwen3 Flash Next本地实测:142 tokens/s的私有编程助手怎么搭

海外博主实测Qwen3 Flash Next本地运行跑出142.6 tokens/s。本文详解从Unsloth安装、编程任务实操到推测解码与MTP多token预测的完整搭建思路,教你打造私有的本地代码修复助手。

阅读全文 →
Hermes Agent 完全指南:本地部署、技能系统与对比 OpenClaw
·5 分钟

Hermes Agent 完全指南:本地部署、技能系统与对比 OpenClaw

Hermes Agent 是 Nous Research 推出的 MIT 开源自改进 AI 智能体,支持自动生成技能、持久记忆与多平台接入。本文详解其特性、基于 Ollama 的本地部署方法、技能系统运作原理,以及与 OpenClaw 的对比。

阅读全文 →
本地小模型撑起百万Token上下文,Spark X如何做到?
·6 分钟

本地小模型撑起百万Token上下文,Spark X如何做到?

Spark X 2.5(4B)开源小模型宣称支持百万Token上下文,靠的是36层中仅9层追踪全文的稀疏注意力架构。本文拆解其设计原理、KV Cache内存账单及128K以内的真实可用区间。

阅读全文 →
本地部署别搞错:Ollama、llama.cpp与OpenAI区别详解
·5 分钟

本地部署别搞错:Ollama、llama.cpp与OpenAI区别详解

Ollama、llama.cpp和OpenAI经常被放在一起讨论却分属不同层次。本文一次讲清三者定位:Ollama负责便捷运行本地模型,llama.cpp是底层推理引擎,OpenAI走云端API路线,帮你选对本地部署方案。

阅读全文 →
英伟达 Kimodo AI 动画生成器 CPU 本地部署完全指南
·6 分钟

英伟达 Kimodo AI 动画生成器 CPU 本地部署完全指南

英伟达 Kimodo AI 动画生成器现已支持 CPU 及低显存本地部署。本文详解 Kimodo CPP 的硬件要求、Windows 安装流程、Soma/G1 骨架选择与授权、GLB 导出及导入 Unreal Engine 的完整方法。

阅读全文 →
本地AI小白部署指南:Gemma、LM Studio与Ollama实战
·10 分钟

本地AI小白部署指南:Gemma、LM Studio与Ollama实战

本地AI小白入门完整指南:从Gemma模型、LM Studio、Ollama到Hugging Face,讲清本地与云端AI的区别、核心术语、三条部署路径和硬件建议,并给出三个可落地的本地AI创业点子。

阅读全文 →
AI MAX+ 395部署Qwen3大模型:GFX1151引擎实测优化解析
·6 分钟

AI MAX+ 395部署Qwen3大模型:GFX1151引擎实测优化解析

B站UP主防暴键盘更新GFX1151 engine引擎,针对AMD AI MAX+ 395平台部署Qwen3大模型。本文解析MOE内核优化、HGN/GGUF双格式支持、分页KV与并发能力及本机实测数据。

阅读全文 →
显卡涨疯了怎么办?统一内存+独显异构加速部署大模型
·7 分钟

显卡涨疯了怎么办?统一内存+独显异构加速部署大模型

RTX 5090和Pro 6000显卡价格翻倍,本地部署大模型成本飙升。本文解析统一内存+独显异构加速开源方案,拆解Prefill与Decode分工原理,实测三条路径数据,4万美元跑DeepSeek V4.1 Flash成本降至五分之一。

阅读全文 →
Swift1.5-Qwen3.8-Flash-Next实测:推理提速60%,质量几乎无损
·5 分钟

Swift1.5-Qwen3.8-Flash-Next实测:推理提速60%,质量几乎无损

Swift-1.5-Qwen3.8-Flash-Next实测对比基础版Qwen3.8-Flash:Aider编程基准显示其推理token和耗时降至40%,质量几乎无损,C++场景需留意。本地大模型效率优化实录。

阅读全文 →
开源判断模型实测:为什么它中文只有20分却值得部署
·9 分钟

开源判断模型实测:为什么它中文只有20分却值得部署

开源判断模型实测:非自回归架构带来常数级延迟,中文仅20分却是速度与确定性利器。含小主机 OOM 排查、三档量化内存账、Cloudflare 边缘网关部署踩坑全记录。

阅读全文 →
Colibri开源引擎:普通电脑也能跑2.8T大模型
·4 分钟

Colibri开源引擎:普通电脑也能跑2.8T大模型

开源推理引擎 Colibri 把硬盘当内存用,专家按需读取,让普通消费级电脑也能运行从 744B 到 2.8T 的大模型,支持 GLM、Kimi、DeepSeek 等九大家族,三条命令即可上手,Apache 2.0 开源。

阅读全文 →
Qwen3+RAGFlow零成本搭建本地知识库全流程教程
·9 分钟

Qwen3+RAGFlow零成本搭建本地知识库全流程教程

手把手教你用Ollama、Qwen3和RAGFlow零成本搭建本地知识库智能助手,从Docker环境配置、模型集成到向量检索全流程详解,消除大模型幻觉,数据隐私可控,小白也能上手。

阅读全文 →
MiniMax H3长视频工作流实测:6G显存跑2分钟高清动画
·5 分钟

MiniMax H3长视频工作流实测:6G显存跑2分钟高清动画

MiniMax H3长视频ComfyUI工作流实测分享:通过Motion Context机制突破15秒时长上限,配合分块处理和显存清理节点,让6G-12G低显存显卡也能本地生成2分钟高清动画,附操作流程与提示词技巧。

阅读全文 →
7000美元本地AI全套配置揭秘:硬件、模型与提速技巧
·9 分钟

7000美元本地AI全套配置揭秘:硬件、模型与提速技巧

一位B站UP主分享其耗资7000美元搭建的本地AI全套配置:NVIDIA GB超级芯片硬件、Qwen/Nemotron模型选型、llama.cpp与vLLM推理引擎,以及量化、推测解码等提速技巧,实测大模型提速64%。

阅读全文 →
ADM本地大模型部署工具:一键启动开箱即用
·4 分钟

ADM本地大模型部署工具:一键启动开箱即用

ADM是一款支持Windows、Linux和macOS的开源本地大模型部署工具,主打一键部署、开箱即用、图形化界面,内置Agent可执行命令读写文件,支持60K上下文与MTP推测解码,数据全本地存储保护隐私。

阅读全文 →
本地部署Laya决策模型:45ms响应、零成本的开源替代方案
·5 分钟

本地部署Laya决策模型:45ms响应、零成本的开源替代方案

开源决策模型Laya本地部署实测:421MB模型体积、单次决策仅45ms、可跑60fps,对比云端Jev的300ms延迟优势明显。本文详解通过Panel AI一键部署Laya的完整流程与注意事项。

阅读全文 →