Concept
GGUF
GGUF(GPT-Generated Unified Format)是一种用于存储和分发大型语言模型的二进制文件格式,由llama.cpp项目设计并推广。它将模型权重、元数据及量化参数统一封装于单一文件中,支持多种量化精度级别,以减少模型体积和内存占用。GGUF被广泛用于本地推理场景,兼容多种推理框架和硬件平台。
Timeline (last 90 days)
Jun 3
7B参数的量化模型在16GB内存的普通电脑上即可流畅对话
Unverified70%
Jun 1
模型量化技术(如GGUF格式的4-bit/8-bit量化)使得原本需要数十GB显存的大模型可以在消费级GPU甚至CPU上运行
Verified80%
Jun 1
模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行
Verified65%
Jun 1
Unsloth推出了Granite 4.1 3B模型的GGUF格式量化版本集合,共21个不同的量化模型文件
Unverified60%
Jun 1
Hugging Face模型库中已有数万个GGUF格式的模型文件
Unverified80%
Jun 1
GGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案
Verified90%
Jun 1
GGUF格式由llama.cpp项目创始人Georgi Gerganov设计
Verified90%
Jun 1
Unsloth为Granite 4.1 3B模型发布了21种GGUF格式量化版本,文件大小从1.2GB到6.34GB不等,总计约51.3GB
Unverified60%
Jun 1
Unsloth支持导出为GGUF(llama.cpp格式)、safetensors等多种格式,方便部署到Ollama、vLLM等推理框架
Unverified90%
Jun 1
一个7B参数的模型经过4-bit量化后仅需约4GB显存即可运行
Verified80%
22 more timeline events
All Facts (1)
Source Articles
MiniMax M3本地部署:激活参数23B≠显存23B,MoE架构全解析Jul 21本地AI模型 vs 云端:这道技术判断题正在考验你的认知深度Jul 21Goku:基于WebAssembly的浏览器端LLM推理引擎与模型管理器Jul 20Ollama完全指南:本地运行大语言模型的最简方案Jul 19Bonsai 27B:首个在手机运行的1-bit大模型,端侧AI新突破Jul 17单张RTX 3090本地跑Qwen3.6 27B:性能媲美云端的完整指南Jul 15Ollama获6500万美元B轮:85%财富500强已部署本地大模型Jul 11低显存也能跑!ID LoRA人脸转视频工作流实测解析Jul 11