[控场AI]
概念Prefix Caching / Prefix Cache

前缀缓存

LLM推理优化技术,通过缓存并复用相同前缀请求的KV Cache,减少重复计算,显著提升多轮对话和批量相似请求的处理效率

来源文章