llama.cpp
llama.cpp是由Georgi Gerganov发起的开源大语言模型推理框架,使用纯C/C++实现,无需依赖外部深度学习库。该项目支持在CPU、GPU及Apple Silicon等多种硬件上运行大型语言模型,提供多种模型量化方案以降低内存占用和计算需求,并兼容多种主流开源模型格式,广泛应用于本地化大模型部署场景。
Core Facts
Timeline (last 90 days)
带 Qwen3.5 骨干的 Clef 模型和 Laya 模型都能导出为 GGUF 格式并通过 llama.cpp 提供服务,包括能理解图像的多模态决策模型
IQ3 属于 GGUF 格式下的非均匀量化方案,由 llama.cpp 社区发展而来,相较于早期 Q3_K 等均匀量化方式在同等压缩比下能更好保留关键权重
MLC LLM通常比llama.cpp的纯CPU推理有更高吞吐量
开源模型生态(如Llama、Mistral等系列)的成熟以及llama.cpp、MLC LLM等移动端推理框架的出现,降低了个人在手机上搭建AI助手的门槛
EmbeddingGemma 2 支持的工具链包括 MediaPipe、Transformers.js 加 WebGPU、Ollama、llama.cpp、MLX、LM Studio,微调可参考 Unsloth
该 PR 的技术思路是为存放在主机内存(系统 RAM)中的 MoE 专家权重在 GPU 侧建立一层缓存机制
该 PR 的目标用户是使用单张消费级显卡(如 8GB、12GB、16GB 显存)运行超出显存容量的 MoE 模型、依赖 CPU offload 的个人用户
作者在发布 PR 时主动邀请社区成员提交各自的实测提速数据
该 MoE 专家 GPU 缓存改动目前仍处于 Pull Request 阶段,尚未合并进主线,具体加速幅度和稳定性有待社区验证
llama.cpp 收到编号为 #29887 的 Pull Request,由贡献者 am17an 提交,旨在为无法完全装入显存的 MoE 模型提供推理加速
40 more timeline events
All Facts (20)
llama.cpp 由 Georgi Gerganov 以纯 C/C++ 实现,GGUF 格式将模型架构元数据、词表和量化权重打包进单一文件
90%VerifiedGGUF 格式由 llama.cpp 项目引入,专为 CPU 推理场景优化
90%VerifiedGGUF 将模型权重、分词器词表、超参数配置等全部打包进单一文件,支持 Q2_K、Q4_K_M、Q8_0 等多种量化精度
90%Verifiedllama.cpp是由Georgi Gerganov开发的纯C/C++推理引擎,支持在纯CPU环境下运行大模型
90%VerifiedGGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案
90%Verifiedllama.cpp由Georgi Gerganov于2023年3月发起
90%VerifiedGGUF格式由llama.cpp项目创始人Georgi Gerganov设计
90%VerifiedGGUF(GPT-Generated Unified Format)是由llama.cpp项目定义的模型文件格式
90%VerifiedMLX针对Apple Silicon的统一内存架构进行专项优化
85%VerifiedGGUF 已成为 llama.cpp、Ollama、LM Studio 等主流本地推理工具的事实标准格式
85%VerifiedGGUF是由llama.cpp项目引入的模型格式标准,支持Q2_K至Q8_0等多种量化级别
80%Verifiedllama.cpp项目将GGUF量化格式推向主流,支持从Q2_K到Q8_0等多种精度等级
80%VerifiedOllama将本地模型部署简化为一条命令行指令,并提供与OpenAI兼容的本地API接口
80%Verifiedllama.cpp支持Metal、CUDA、Vulkan和SYCL等GPU加速后端
80%Verifiedllama.cpp是由开发者Georgi Gerganov于2023年发起的开源项目,使用纯C/C++实现了LLaMA系列模型的推理
80%VerifiedOpen WebUI 支持 Ollama 和 OpenAI API 等多种后端
80%VerifiedOllama底层基于llama.cpp的推理引擎,原生支持GGUF格式的量化模型
80%VerifiedOllama是一个开源的本地大模型运行时,底层基于llama.cpp实现,支持CPU和GPU混合推理
80%Verifiedllama.cpp是一个高度优化的C++推理引擎,支持Apple Silicon的Metal加速、NVIDIA的CUDA加速以及AMD的ROCm加速
80%VerifiedOllama提供类似Docker的一键式模型管理体验,vLLM通过PagedAttention实现高吞吐量批量推理,LM Studio面向桌面用户提供图形化界面
80%