概念本地推理 / 本地化部署 / Local LLM
大模型本地部署
指将大型语言模型部署在本地硬件(如个人PC、服务器)上运行推理,无需依赖云端API,具备数据隐私保护和离线使用的优势,通常借助llama.cpp、vLLM等推理框架实现。
时间轴 (近 90 天)
8月31日
评估本地部署显存需求应先明确目标精度和目标上下文长度再倒推所需显存,而非仅看参数量
待验证50%
指将大型语言模型部署在本地硬件(如个人PC、服务器)上运行推理,无需依赖云端API,具备数据隐私保护和离线使用的优势,通常借助llama.cpp、vLLM等推理框架实现。
评估本地部署显存需求应先明确目标精度和目标上下文长度再倒推所需显存,而非仅看参数量