[控场AI]

#模型量化

共 26 篇相关文章

RTX 4090 跑 125B 大模型:Qwen3 Next 实现 100 T/s 推理
·4 分钟

RTX 4090 跑 125B 大模型:Qwen3 Next 实现 100 T/s 推理

开发者在单张 RTX 4090 消费级显卡上运行 125B 参数的 Qwen3 Next Flash 模型,实现约 100 tokens/s 推理速度。本文解析 MoE 架构、量化技术如何让千亿大模型落地消费级硬件。

阅读全文 →
6GB跑27B大模型?Bonsai 2三值量化的真相与局限
·7 分钟

6GB跑27B大模型?Bonsai 2三值量化的真相与局限

Prism ML的Bonsai 2号称6GB显存保留Qwen3-27B 98%性能。实测显示短任务确实打平,但长链agentic构建全线崩溃。本文剖析三值量化原理与压缩技术的真实局限。

阅读全文 →
Bonsai 2实测:27B模型压进6GB,98%性能是真的吗?
·5 分钟

Bonsai 2实测:27B模型压进6GB,98%性能是真的吗?

Bonsai 2将Qwen 27B模型三值量化压缩进6GB文件,可在MacBook本地运行,宣称保留98%性能。实测显示它在聊天问答中表现优秀,但在长程agentic任务中会陷入重复循环无法完成,本文解析其适用边界。

阅读全文 →
HF热榜深度解析:Qwen-Image-2.1生态霸榜,开源模型迎来爆发时刻
·7 分钟

HF热榜深度解析:Qwen-Image-2.1生态霸榜,开源模型迎来爆发时刻

Hugging Face最新热榜深度解析:Qwen-Image-2.1生态三天567万下载霸榜,DeepSeek-V4.1-Flash以763B参数和890字节KV缓存压缩杀入前列,LTX-2.5视频生成158万下载。开源模型竞争从拼参数转向拼落地效率。

阅读全文 →
无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨
·5 分钟

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨

一场Reddit讨论探讨了无GPU本地部署大模型的可行性:用老旧DDR3多路服务器靠内存带宽跑Qwen 3.8 Flash,以及4bit量化、KV缓存与上下文长度的实用权衡与电费成本争议。

阅读全文 →
大模型本地部署实战:Ollama、vLLM与量化方案全解析
·6 分钟

大模型本地部署实战:Ollama、vLLM与量化方案全解析

大模型本地部署完整指南:对比 Ollama、vLLM、LM Studio 三大工具的适用场景,以通义千问 Qwen3.8 的 27B 模型为例详解 BF16、FP8、INT4 等量化方案的显存需求与显卡选型建议。

阅读全文 →
英伟达Jetson本地跑Qwen3 27B:NVFP4+投机解码实测解析
·4 分钟

英伟达Jetson本地跑Qwen3 27B:NVFP4+投机解码实测解析

英伟达在Jetson平台针对Qwen3 27B稠密模型做本地推理优化,采用NVFP4量化叠加投机解码的最优组合,让高端大模型在边缘设备上从能跑到能用。本文解析其技术原理与本地部署价值。

阅读全文 →
ESP32S3集群运行1.58位BitNet语言模型:边缘AI的极致探索
·4 分钟

ESP32S3集群运行1.58位BitNet语言模型:边缘AI的极致探索

开发者用ESP32S3微控制器集群运行1.58位BitNet量化语言模型,探索边缘AI的硬件极限。本文解析三值量化原理、分布式推理挑战及其对低功耗AI部署的意义。

阅读全文 →
Qwen Flash Next IQ4量化实测:低量化真的不如FP8吗?
·6 分钟

Qwen Flash Next IQ4量化实测:低量化真的不如FP8吗?

Reddit 用户实测 Qwen Flash Next IQ4_XS 与 Qwen3 27B FP8 的跑分对比,涵盖 MMLU-Pro、GPQA、GSM8K 等基准。结果显示低量化 Flash Next 精度反超 FP8,但 FP8 并发速度快约 4 倍。

阅读全文 →
12GB显卡跑Qwen3.8-Flash-Next:自研引擎实现65 tok/s
·6 分钟

12GB显卡跑Qwen3.8-Flash-Next:自研引擎实现65 tok/s

开发者用自研Strata推理引擎在12GB RTX 5070上运行Qwen3.8-Flash-Next,输出速度达65 tok/s,比llama.cpp提升近4倍。附完整量化性能数据、硬件配置与开源地址。

阅读全文 →
421M参数Laya模型玩转Flappy Bird:CPU上的OpenVINO INT8推理实践
·5 分钟

421M参数Laya模型玩转Flappy Bird:CPU上的OpenVINO INT8推理实践

一位开发者用OpenVINO将421M参数的Laya模型量化到INT8,成功在英特尔i7 CPU上运行Flappy Bird游戏。本文拆解OpenVINO转换、INT8量化的技术要点,以及消费级CPU运行数亿参数模型对端侧AI部署的意义。

阅读全文 →
16GB显存是多数人的天花板:本地大模型的现实与未来
·4 分钟

16GB显存是多数人的天花板:本地大模型的现实与未来

为什么16GB甚至12GB显存才是多数人跑本地大模型的现实上限?本文解析小显存下的AI能力现状——量化模型让agentic编程成为可能,同时探讨世界知识的硬性限制与超越Transformer架构的未来方向。

阅读全文 →
低显存本地大模型对决:Bonsai 2量化版为何胜出
·6 分钟

低显存本地大模型对决:Bonsai 2量化版为何胜出

Reddit 用户在 RTX 5090 上横评 Bonsai 2 27B、Gemma 4 12B 与 Qwen 3.5 9B。基于三元量化的 Bonsai 用 7.2GB 显存实现更优的日式体素宝塔渲染效果,展现低显存本地大模型的量化新趋势。

阅读全文 →
三值权重压缩:27B模型缩至6GB,可在浏览器本地运行
·4 分钟

三值权重压缩:27B模型缩至6GB,可在浏览器本地运行

Ternary Bonsai 2(27B)在Hugging Face发布,采用三值权重将模型压缩至6GB以下,仅为FP16的九分之一,官方称保留98.2%性能,并支持通过WebGPU在浏览器本地运行。

阅读全文 →
本地大模型变笨了?揭开Q4量化陷阱与自测指南
·9 分钟

本地大模型变笨了?揭开Q4量化陷阱与自测指南

本地大模型跑起来变笨?问题可能出在你从未主动选择的Q4量化版本。本文解析量化陷阱、KV cache影响与运行器差异,并给出五分钟自测指南,帮你分清是量化还是模型本身的问题。

阅读全文 →
19.8MB的LLM:44M参数模型如何在CPU上跑出1900 tok/s
·8 分钟

19.8MB的LLM:44M参数模型如何在CPU上跑出1900 tok/s

开发者QLNI从零训练出仅19.8MB、44M参数的量化语言模型SHADOW-50M,采用三元权重和冻结指纹词表,CPU上跑出约1900 tok/s。它把计算交给专用电路、记忆交给磁盘索引,在精确计算与可靠检索任务上超越同级模型。

阅读全文 →
Voodoo Dynamic Quant开源:用梯度下降优化模型量化
·6 分钟

Voodoo Dynamic Quant开源:用梯度下降优化模型量化

开发者开源动态量化方法 Voodoo Dynamic Quant,采用 MIT 协议。它用梯度下降优化 GGUF 模型的逐张量量化布局,在激进低比特档位优于 Unsloth Dynamic 3.0,为低显存本地部署提供新工具。

阅读全文 →
bartowski更新GGUF量化:逐张量布局图解析
·4 分钟

bartowski更新GGUF量化:逐张量布局图解析

bartowski 更新 Qwen3.8-27B-GGUF 模型仓库,引入逐张量布局映射(Per-tensor layout),以图表和表格展示每个张量的量化类型,提升 GGUF 量化的透明度与可解释性,帮助本地大模型用户更理性地选择量化版本。

阅读全文 →