[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Prefix Caching / Prefix Cache
前缀缓存
LLM推理优化技术,通过缓存并复用相同前缀请求的KV Cache,减少重复计算,显著提升多轮对话和批量相似请求的处理效率
来源文章
vLLM v0.29.0更新:修复混合模型前缀缓存Bug
9月11日
vLLM v0.29.0rc2发布:多模态共享内存缓存修复详解
9月11日