Prompt Caching
Anthropic推出的定价优化机制,对请求中可复用的固定前缀部分(如System Prompt)对应的Token给予费用折扣,将KV Cache节省反映到计费中
核心事实
时间轴 (近 90 天)
长篇创意写作等以输出为主的任务缓存优势有限,模型啰嗦度提升会直接推高账单
对于RAG、代码助手、客服机器人等场景,缓存token往往占总调用量的60%-80%
Token 缓存(Prompt Caching)是大模型 API 中的成本优化机制,当同一段前缀在多次请求中重复出现时可缓存计算结果并收取更低费用
重构后的缓存在对话中途调高推理等级或使用新工具时不会导致缓存失效
Token成本控制的常见手段包括截断历史对话、使用摘要压缩记忆、对不同任务分级选用不同规模的模型
Anthropic 在 Claude 3 系列中率先将提示词缓存机制做成可计费的显式功能,允许开发者主动标记需要缓存的内容块
无状态场景下缓存几乎不产生收益,纯单价决定成本;有状态场景下缓存命中率是决定账单的关键变量
无状态调用指每次请求携带的上下文彼此独立,有状态调用指每次请求携带相同的系统提示词、工具定义或长篇背景文档,区分二者是缓存价值选型的核心维度
在系统提示词数千 token 的 Agent 场景中,若90%以上的请求命中缓存,实际每次请求的有效输入成本可能只有挂牌价的5%-10%
要最大化缓存命中率,工程上需将稳定不变的内容置于请求最前部,将频繁变化的内容放在末尾,让尽可能长的前缀被复用
还有 40 条时间轴事件
全部知识事实 (20)
Claude API 支持提示缓存(Prompt Caching)机制,内容首次请求计费全价,后续命中缓存的 token 费用约为原价的 10%
80%已验证提示词缓存(Prompt Caching)机制可复用相同前缀上下文的 KV Cache,通常可节省 50%~90% 的输入 token 成本
80%已验证提示缓存的核心原理是KV Cache的跨请求复用,当多个请求共享相同前缀时已计算的KV状态可被缓存复用
75%已验证Anthropic 的 prompt caching 功能允许对重复出现的系统提示或代码文件进行缓存以降低输入 Token 成本
75%已验证Anthropic的提示词缓存机制中缓存命中token仅收标准价格10%的优惠
70%已验证在缓存命中场景下,命中的 token 通常按原价的 1/10 甚至更低收费
65%已验证硬盘缓存机制将已计算的KV Cache持久化到存储介质中,当后续请求前缀与缓存命中时可直接复用,跳过重复的前向传播
65%已验证Prompt Caching通过复用相同前缀的KV Cache跳过重复计算,降低延迟和Token费用
65%待验证Anthropic's Prompt Caching can reduce repeated input costs by 90%
80%待验证提示词缓存技术将KV矩阵存储在高速内存中,当下一次请求包含相同前缀内容时直接读取缓存跳过重算
70%待验证前缀匹配要求只有从第一个token开始完全一致的连续序列才能命中缓存
70%待验证提示缓存采用严格的前缀匹配策略,一旦某位置出现不匹配,该位置之后的所有缓存全部失效
60%待验证长篇创意写作等以输出为主的任务缓存优势有限,模型啰嗦度提升会直接推高账单
50%待验证对于RAG、代码助手、客服机器人等场景,缓存token往往占总调用量的60%-80%
50%待验证Token 缓存(Prompt Caching)是大模型 API 中的成本优化机制,当同一段前缀在多次请求中重复出现时可缓存计算结果并收取更低费用
50%待验证重构后的缓存在对话中途调高推理等级或使用新工具时不会导致缓存失效
50%待验证Token成本控制的常见手段包括截断历史对话、使用摘要压缩记忆、对不同任务分级选用不同规模的模型
50%待验证Anthropic 在 Claude 3 系列中率先将提示词缓存机制做成可计费的显式功能,允许开发者主动标记需要缓存的内容块
50%待验证在系统提示词数千 token 的 Agent 场景中,若90%以上的请求命中缓存,实际每次请求的有效输入成本可能只有挂牌价的5%-10%
50%待验证无状态调用指每次请求携带的上下文彼此独立,有状态调用指每次请求携带相同的系统提示词、工具定义或长篇背景文档,区分二者是缓存价值选型的核心维度
50%