GGUF(GPT-Generated Unified Format)是一种用于存储和分发大型语言模型的二进制文件格式,由llama.cpp项目设计并推广。它将模型权重、元数据及量化参数统一封装于单一文件中,支持多种量化精度级别,以减少模型体积和内存占用。GGUF被广泛用于本地推理场景,兼容多种推理框架和硬件平台。
在 GGUF 量化中,一个模型文件对不同的张量采用不同的量化方案,注意力层、前馈层、嵌入层可能各自使用不同的量化位宽和量化类型
作者以四种形态开放资源:合并后的GGUF、独立F32 LoRA适配器、在线Demo Space和免费的OpenAI兼容接口
EmsyAI最终权重导出为GGUF格式,可在Ollama中运行
工具选择建议为:初学者选Ollama,生产级开发者选vLLM,希望与社区共享模型的用户选GGUF生态
llama.cpp通过GGUF格式统一模型存储,并针对ARM NEON、AVX2、Metal等主流指令集做了专项加速
从 llama.cpp 衍生出的 GGUF 格式成为了本地 AI 社区事实上的模型分发标准
Hugging Face 上有海量的 GGUF 量化模型
Ollama和LM Studio是推荐的本地模型运行框架,比手动配置GGUF更省心
GGUF不是一种量化算法,而是一个生态系统容器格式
llama.cpp 由 Georgi Gerganov 开发,使用纯 C/C++ 实现,通过 GGUF 格式量化权重压缩模型体积和显存占用
还有 40 条时间轴事件
llama.cpp是由Georgi Gerganov开发的纯C/C++推理引擎,支持在纯CPU环境下运行大模型
90%已验证GGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案
90%已验证GGUF格式由llama.cpp项目创始人Georgi Gerganov设计
90%已验证GGUF(GPT-Generated Unified Format)是由llama.cpp项目定义的模型文件格式
90%已验证llama.cpp 由 Georgi Gerganov 以纯 C/C++ 实现,GGUF 格式将模型架构元数据、词表和量化权重打包进单一文件
80%已验证GPTQ和AWQ量化格式主要用于GPU推理
80%已验证llama.cpp是由开发者Georgi Gerganov于2023年发起的开源项目,使用纯C/C++实现了LLaMA系列模型的推理
80%已验证GGUF格式的4-bit量化可将模型权重从32位浮点压缩到4位整数,模型体积缩小约8倍
80%已验证Qwen2.5:7B模型Q4量化后文件大小约为4GB
80%已验证GGUF 已成为 llama.cpp、Ollama、LM Studio 等主流本地推理工具的事实标准格式
75%已验证llama.cpp是一个纯C/C++实现的推理框架,支持CPU推理和极低比特量化(如4-bit、2-bit),可在笔记本电脑甚至树莓派上运行LLM
70%已验证常见的模型量化方法包括GPTQ、AWQ和GGUF等格式
70%已验证Ollama基于llama.cpp项目构建,后者由Georgi Gerganov开发
70%已验证LM Studio提供图形化界面,适合不熟悉命令行的用户
65%已验证GGUF专门为CPU和混合CPU/GPU推理场景优化,支持内存映射(mmap)加载,可通过部分offload到系统内存运行超出显存容量的模型
65%已验证GGUF 格式由 llama.cpp 创始人 Georgi Gerganov 于2023年推出,已成为开源模型本地化部署的事实标准
65%已验证量化格式可将70B参数模型的运行内存从140GB压缩至40GB以内
65%已验证GGUF格式支持4-bit、8-bit等多种精度级别,可将70亿参数模型的内存占用从约14GB(FP16)压缩至约4GB(Q4_K_M量化),推理精度损失通常在1-3%以内
65%已验证GGUF 将模型权重、量化参数、词表、超参数打包进单一文件,并支持内存映射(mmap)加载
65%已验证llama.cpp通过量化技术将模型权重从32位浮点压缩至4位或8位整数,降低硬件门槛,使消费级GPU甚至纯CPU也能运行数十亿参数规模的模型
65%