上下文缓存(Context Caching)是一种将已处理的上下文信息存储于缓存层、供后续请求复用的技术机制。其核心目标是避免对相同上下文的重复计算,从而提升系统响应效率并降低资源消耗。该技术广泛应用于大语言模型推理、对话系统及分布式计算等场景,尤其适用于需要频繁引用大量共享上下文的工作负载,是优化计算性能与成本的重要手段。
Firebase AI Logic的Context Caching功能通过缓存KV Cache(Transformer注意力机制中的中间计算结果)来复用频繁使用的上下文片段
根据Google官方数据,Context Caching对于包含大量共享上下文的场景可以将输入Token成本降低最多75%
Context Caching功能可以显著减少首Token生成时间(Time to First Token)
Gemini的Context Caching功能可以为反复查询的长文件节省高达90%的API调用成本