[KongchangAI]
Concept

GGUF

GGUF(GPT-Generated Unified Format)是一种用于存储和分发大型语言模型的二进制文件格式,由llama.cpp项目设计并推广。它将模型权重、元数据及量化参数统一封装于单一文件中,支持多种量化精度级别,以减少模型体积和内存占用。GGUF被广泛用于本地推理场景,兼容多种推理框架和硬件平台。

Timeline (last 90 days)

Jun 3

7B参数的量化模型在16GB内存的普通电脑上即可流畅对话

Unverified70%
Jun 1

模型量化技术(如GGUF格式的4-bit/8-bit量化)使得原本需要数十GB显存的大模型可以在消费级GPU甚至CPU上运行

Verified80%
Jun 1

模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行

Verified65%
Jun 1

Unsloth推出了Granite 4.1 3B模型的GGUF格式量化版本集合,共21个不同的量化模型文件

Unverified60%
Jun 1

Hugging Face模型库中已有数万个GGUF格式的模型文件

Unverified80%
Jun 1

GGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案

Verified90%
Jun 1

GGUF格式由llama.cpp项目创始人Georgi Gerganov设计

Verified90%
Jun 1

Unsloth为Granite 4.1 3B模型发布了21种GGUF格式量化版本,文件大小从1.2GB到6.34GB不等,总计约51.3GB

Unverified60%
Jun 1

Unsloth支持导出为GGUF(llama.cpp格式)、safetensors等多种格式,方便部署到Ollama、vLLM等推理框架

Unverified90%
Jun 1

一个7B参数的模型经过4-bit量化后仅需约4GB显存即可运行

Verified80%

22 more timeline events

All Facts (1)

Source Articles