llama.cpp是由Georgi Gerganov发起的开源大语言模型推理框架,使用纯C/C++实现,无需依赖外部深度学习库。该项目支持在CPU、GPU及Apple Silicon等多种硬件上运行大型语言模型,提供多种模型量化方案以降低内存占用和计算需求,并兼容多种主流开源模型格式,广泛应用于本地化大模型部署场景。
llama.cpp专门针对CPU和Apple Silicon进行了深度优化
LM Studio底层基于llama.cpp,但加载带MTP的模型会直接失败
llama.cpp部署时应选择CUDA 12.4版本而非13.x,因为13.x目前存在已知bug
llama.cpp正式将MTP(Multi-Token Prediction)技术纳入主线支持
llama.cpp、Ollama、vLLM等推理框架可让用户在消费级硬件上运行量化后的开源模型
常见的本地推理框架包括Ollama、llama.cpp、vLLM
Ollama通过Go语言的CGo机制桥接llama.cpp的C/C++推理内核,无需安装Python或任何深度学习框架
llama.cpp是一个纯C/C++实现的推理框架,支持CPU推理和极低比特量化(如4-bit、2-bit),可在笔记本电脑甚至树莓派上运行LLM
llama.cpp是由Georgi Gerganov开发的纯C/C++推理引擎,支持在纯CPU环境下运行大模型
Ollama底层依赖llama.cpp推理引擎
25 more timeline events