Prompt Caching
Anthropic推出的定价优化机制,对请求中可复用的固定前缀部分(如System Prompt)对应的Token给予费用折扣,将KV Cache节省反映到计费中
Timeline (last 90 days)
切换模型、切换推理强度、开关快速推理模式、压缩对话、缓存过期后恢复等操作都会导致提示缓存失效
提示词缓存技术将KV矩阵存储在高速内存中,当下一次请求包含相同前缀内容时直接读取缓存跳过重算
Prompt Caching缓存命中读取仅需基础输入的0.1倍价格,首次写入成本是常规输入的2倍
Anthropic推出了Prompt Caching技术以减少重复Token的计算开销
OpenAI 的 Prompt Caching 机制自动对相同前缀进行缓存,开发者无需额外操作
Prompt Caching可将公共前缀的KV Cache持久化存储,成本可降至普通输入的10-20%
Codex在Agent多轮对话中会大量复用系统提示和代码上下文,缓存命中率远超普通聊天场景,是折算价格低廉的关键原因
提示缓存采用严格的前缀匹配策略,一旦某位置出现不匹配,该位置之后的所有缓存全部失效
前缀匹配要求只有从第一个token开始完全一致的连续序列才能命中缓存
Anthropic's Prompt Caching can reduce repeated input costs by 90%
4 more timeline events
All Facts (14)
Anthropic's Prompt Caching can reduce repeated input costs by 90%
80%Unverified切换模型、切换推理强度、开关快速推理模式、压缩对话、缓存过期后恢复等操作都会导致提示缓存失效
50%Unverified提示词缓存技术将KV矩阵存储在高速内存中,当下一次请求包含相同前缀内容时直接读取缓存跳过重算
50%UnverifiedPrompt Caching缓存命中读取仅需基础输入的0.1倍价格,首次写入成本是常规输入的2倍
50%UnverifiedOpenAI 的 Prompt Caching 机制自动对相同前缀进行缓存,开发者无需额外操作
50%UnverifiedPrompt Caching可将公共前缀的KV Cache持久化存储,成本可降至普通输入的10-20%
50%UnverifiedCodex在Agent多轮对话中会大量复用系统提示和代码上下文,缓存命中率远超普通聊天场景,是折算价格低廉的关键原因
50%Unverified提示缓存采用严格的前缀匹配策略,一旦某位置出现不匹配,该位置之后的所有缓存全部失效
50%Unverified前缀匹配要求只有从第一个token开始完全一致的连续序列才能命中缓存
50%UnverifiedAnthropic 的 prompt caching 功能允许对重复出现的系统提示或代码文件进行缓存以降低输入 Token 成本
50%UnverifiedAnthropic 的 prompt caching 功能使缓存命中的输入 Token 费用降至原价的 10%
50%Unverified提示词缓存(Prompt Caching)机制可复用相同前缀上下文的 KV Cache,通常可节省 50%~90% 的输入 token 成本
50%UnverifiedAnthropic 的 Prompt Caching API 要求缓存前缀至少达到1024个 token,缓存有效期通常为5分钟,在活跃会话中可自动续期
50%UnverifiedAnthropic推出了Prompt Caching技术以减少重复Token的计算开销
50%