[控场AI]
· 4 分钟阅读· 2,004 字

OpenAI改进GPT-6提示缓存:Agent更快更省,缓存输入折扣高达90%

OpenAI改进GPT-6提示缓存:Agent更快更省,缓存输入折扣高达90%

OpenAI升级GPT-6 API提示缓存,默认提供更高命中率,缓存token最高享90%折扣,同步降低Agent应用成本与延迟。

OpenAI宣布对GPT-6 API的提示缓存机制进行升级,核心改进是在默认情况下提供更高的缓存命中率,使更多重复输入的token能够享受最高达90%的价格折扣。提示缓存的原理是将请求中稳定不变的前缀内容(如系统提示、工具定义、历史对话)缓存在服务端,后续请求命中时跳过重复计算,从而同时实现降本与提速。这一优化对Agent应用尤为关键——多步骤Agent任务往往包含数十次模型调用,且每次调用中大量上下文高度重叠,缓存效率直接影响应用的经济性与响应速度。开发者在实践中仍可通过将稳定内容前置、监控命中率等方式进一步提升收益。此次升级与GPT-6同步发布,标志着OpenAI在提升模型能力之外,也在为大规模长时运行的Agent做基础设施层面的针对性优化。

OpenAI宣布对其API中的提示缓存(Prompt Caching)机制进行了升级,主要面向即将到来的GPT-6模型。这一改进旨在让基于大模型构建的Agent应用运行得更快、成本更低。核心变化在于:默认情况下提供更高的缓存命中率(cache-hit rate),从而让更多输入token享受到最高达90%的缓存输入折扣。

提示缓存到底解决了什么问题

在实际的Agent或对话类应用中,每一次调用往往会重复携带大量相同的上下文——系统提示词、工具定义、少量示例(few-shot examples)以及历史对话。这些内容在多轮交互中几乎一成不变,但如果每次都作为全新输入被模型处理,就会产生重复的计算开销和费用。

提示缓存的思路是:把这些重复出现的输入前缀缓存起来,后续请求命中缓存时无需重新计费全价,而是按显著折扣结算。OpenAI此次提到的"高达90%的缓存输入折扣",意味着命中缓存的输入token价格可以降到原价的十分之一,这对于高频调用的场景是相当可观的成本节省。

提示缓存在技术实现上依赖于KV Cache(键值缓存)机制。大语言模型在处理输入时,会为每个token计算注意力机制中的Key和Value矩阵,这一过程是推理阶段最主要的计算开销之一。提示缓存的本质是:将输入前缀对应的KV Cache结果存储在服务端,当后续请求的前缀与已缓存内容匹配时,直接复用这些中间计算结果,跳过对该部分的重复计算。因此,缓存命中不仅是一种计费折扣策略,更对应着真实的算力节省——服务器确实少做了计算,这也是为什么命中缓存能同时带来延迟下降和价格折扣两种收益。值得注意的是,缓存匹配通常要求前缀完全一致(包括token序列),这正是开发者需要将稳定内容前置、保持顺序不变的根本原因。

更高的默认缓存命中率意味着什么

此次升级的关键词是"higher cache-hit rates by default"——默认更高的缓存命中率。过去开发者若想充分利用缓存,往往需要在提示结构上做精细设计,确保可复用部分被放在前缀、保持稳定顺序。而OpenAI表示改进后系统能在默认情况下让更多输入token落入缓存区间。

这带来两层价值:

  • 成本层面:更多token享受折扣,直接压低单次调用成本。对于每天调用量巨大的生产级Agent,累积节省可能非常显著。
  • 性能层面:命中缓存不仅省钱,还能减少重复处理带来的延迟,让Agent响应更快。这对多步推理、频繁调用工具的Agent工作流尤为重要。

为什么这对Agent时代格外重要

当前AI应用正从单轮问答走向多步骤、长上下文的Agent形态。一个典型的Agent任务可能包含数十次模型调用,每次都携带庞大且高度重合的上下文。在这种模式下,缓存效率直接决定了应用的经济性和可用性。

OpenAI将这次缓存优化与GPT-6绑定发布,释放出的信号很明确:下一代模型不只是能力更强,运行的基础设施也在为大规模、长时间运行的Agent做针对性优化。缓存命中率的提升、延迟的下降和成本的降低,共同降低了构建复杂Agent的门槛。

Agent应用在架构上通常采用ReAct(Reasoning + Acting)或类似的"思考—行动—观察"循环模式,每一轮循环都会向模型发起新的调用,且上下文随着工具返回结果不断累积。以一个需要调用搜索、代码执行、数据库查询等多种工具的复杂任务为例,完成一项任务可能需要20到50次模型调用,每次调用的输入长度可能达到数万token,而其中系统提示和已有的工具定义schema可能占据60%至80%的固定内容。在这种调用密度下,缓存命中率从60%提升到80%,对单任务总成本的影响可能超过30%。这也意味着,缓存基础设施的效率正在成为决定Agent应用商业可行性的关键变量之一,而不仅仅是锦上添花的优化项。

开发者可以关注的实践要点

虽然OpenAI强调"默认"即可获得更高命中率,但对追求极致成本优化的团队而言,仍值得留意几点:

  • 尽量将稳定不变的内容(系统提示、工具schema)放在提示前部,可变内容放在后部,最大化前缀复用。
  • 监控实际的缓存命中率与折扣覆盖比例,验证优化是否真正生效。
  • 在设计高频Agent循环时,把缓存收益纳入成本估算模型。

需要说明的是,本次信息来自OpenAI官方在社交平台发布的简短公告,具体的定价细节、缓存有效期以及GPT-6的完整能力仍需以官方文档为准。

小结

OpenAI对GPT-6 API提示缓存的改进,本质上是一次面向Agent时代的基础设施优化:通过更高的默认缓存命中率,让更多输入token享受最高90%的折扣,同时提升响应速度。对于依赖大量重复上下文的生产级应用来说,这是一项能同时改善成本与体验的实用升级。

分享:

相关推荐