AI编程助手为何这么烧钱?揭秘Harness背后的真实账单

智能成本在下降,为什么账单却越来越贵?
自OpenAI推出首个推理模型O1以来,AI智能的价格发生了戏剧性的变化。以GPT-5.6为参照,如今同等甚至更强的性能,成本已经比两年前便宜了约2到3倍。这一趋势多少有点印证了「杰文斯悖论」(Jevons Paradox)——当某种资源变得更便宜、更易获取时,人们对它的整体消耗反而会大幅增加。这个悖论最初由英国经济学家威廉·斯坦利·杰文斯在1865年提出,他观察到瓦特改进蒸汽机的效率后,英国的煤炭消耗量反而大幅增加而非减少。在AI领域,这一悖论的表现尤为突出:当推理成本从2023年的每百万token数十美元降至2026年的不到1美元时,开发者开始将AI嵌入到更多场景中——从单次问答扩展到持续运行的Agent工作流、多轮代码审查、自动化测试生成等。每个单独调用确实更便宜了,但调用总量呈指数级增长,最终账单反而上升。智能变得触手可及,越来越多的人开始使用AI。
话说回来,开源模型也在飞速追赶。过去,开源模型在性能上通常落后闭源模型6到18个月,直到2025年才真正开始形成竞争力。而进入2026年,随着Kimi K3、Qwen 3.8 Max、DeepSeek V4、GLM 5.2等模型的崛起,开源阵营已经在各大排行榜上占据了显著位置,成为闭源模型的有力替代方案。开源模型之所以能迅速缩小差距,得益于几个关键技术突破:混合专家模型(MoE)架构的成熟使得社区能以更低的计算成本训练超大参数模型;高质量合成数据管线的普及让训练数据不再是闭源厂商的独家壁垒;推理优化技术(如投机解码、KV缓存压缩、量化部署)的开源共享,使得社区模型在实际部署中的性能损失大幅缩小。这些模型的成功,本质上是开源协作生态在数据、算法和工程三个维度同时达到临界点的结果。
然而,一个被许多人忽视的关键事实是:模型本身的成本,和「包裹」在模型外面的Harness(框架/外壳)的成本,是完全不同的两回事。 这正是许多开发者账单暴涨、却搞不清钱花在哪里的根本原因。
什么是Harness?为什么它是「隐形碎钞机」
大多数人是通过聊天界面使用AI的,这种方式下的Harness非常「薄」——你几乎是在直接与模型对话。这也是目前最主流的AI使用方式。
但一小部分早期采用者和重度用户,使用的是更「厚」的Harness,比如Claude Code、Cursor、OpenCode、Codex、Cline等编程助手。在这些工具里,你不再直接与模型对话,而是通过一个外部媒介——Harness——来间接工作。
从技术架构来看,Harness本质上是一个编排层(orchestration layer),它位于用户和基础模型之间,负责管理上下文、工具调用、状态追踪和多轮交互逻辑。一个典型的编程Harness包含以下组件:系统提示词(定义角色和可用工具)、工具定义(如文件读写、终端执行、搜索等的API Schema)、上下文管理器(决定何时截断、压缩或缓存对话历史)、以及执行沙箱(安全执行模型输出的代码)。理解这一架构的关键在于:每个组件都会贡献额外的token开销,而这些开销在用户界面上几乎完全不可见。
而正是这个中间层,让成本发生了惊人的跃升。根据Anthropic的数据,仅仅因为使用了Agent或多Agent系统,你的花费可能会是直接调用模型的4到15倍。

作者用一个极简的实验揭示了这个差距。他写了一个只有约25个token的短提示:让AI创建一个包含字母表的文件。即便按Opus 5的定价,这个提示加上模型约500个token的回复,直接调用的总成本也不过1美分。
但当他把同样的提示放进Claude Code时,整个交互的成本立刻跳到了37美分——足足贵了近30倍。
系统提示词:通往模型的「过路费」
这种价格暴涨的最大元凶,是Harness层的开销(overhead)。像Claude Code、OpenCode、Cline、Cursor这样的工具,会在每一条发送给模型的消息上,额外附加8000到30000个token。这就像是一套你必须付费才能接触到模型的「工具包」。
这个额外开销,本质上就是系统提示词(System Prompt)。每一个Harness都有系统提示词,而Claude Code之所以系统提示词特别长,是因为它开箱即带大量功能——每一个功能、每一条命令,都需要在系统提示词中向模型详细描述,好让模型理解如何与这个Harness交互。
值得注意的是,系统提示词的长度并非单纯的「越短越好」。更长的系统提示词通常意味着更丰富的工具描述、更精确的行为约束和更完善的错误处理指导。例如,Claude Code的系统提示词之所以长达约2-3万token,是因为它需要向模型描述数十种可用工具(bash执行、文件编辑、搜索、Git操作等)的精确调用格式、参数约束和边界情况处理方式。这是一个经典的工程权衡:系统提示词越详尽,模型的工具调用准确率越高、出错重试的概率越低,但单次调用的基础成本也越高。轻量级Harness如Pi选择极简系统提示词,代价是可能需要更多轮重试来完成复杂任务。

有趣的是,即便使用同样的Opus 5模型、同样的提示,不同Harness的价格却相差悬殊:
- Claude Code:约37美分
- OpenCode:约11美分
- Cline:约7美分
- Pi:约2.5美分
差距如此之大,说明「选对Harness」本身就是一项成本优化。像Cline这样的开源工具,你甚至可以直接去它的GitHub仓库,阅读它系统提示词的长度和结构,理解它的底层运作方式。
Agent的「来回震荡」如何放大成本
很多人对Agentic应用有一个误解,以为提示只发送一次、模型回复一次就结束了。这在聊天应用里确实如此,但在Agent应用里完全不同。
在Agent模式下,Harness和模型之间会发生一种「来回震荡」——像一个递归循环,反复往返,直到模型判断任务真正完成。以「创建字母表文件」为例:
- 请求发给模型,模型决定先检查文件是否已存在;
- Harness去检查电脑,把结果回传给模型;
- 模型再让Harness创建文件;
- Harness创建文件后回传;
- 模型最后让Harness写入内容。
即便是这样一个简单任务,也有大量往返。而对于「从零搭建一个完整网站」这类可能一口气跑10到20分钟的长任务,可以想象这中间会发生多少次往返。关键在于:每一次往返,都携带着完整的系统提示词这个「收费站」,成本因此被成倍放大。
从技术实现角度看,这种往返模式源于当前LLM的根本限制——它们是无状态的。模型本身不保留任何上下文记忆,每次调用都必须重新发送完整的对话历史(包括系统提示词)。虽然一些前沿的Harness开始实现上下文压缩和选择性历史裁剪,但系统提示词作为定义模型行为的基础指令,几乎无法被裁减,因此成为每次往返中不可避免的固定成本。
Prompt缓存:既省钱,又是厂商的印钞机
有没有办法降低这种成本?答案是Prompt缓存(Prompt Caching)。
当我们向模型发送大体积payload时,如果能复用之前已经计算并存储好的缓存,就能同时节省时间和成本。要理解Prompt缓存为何有效,需要了解其底层机制:在Transformer的自回归生成过程中,模型每生成一个新token都需要对所有之前的token进行注意力计算。KV缓存(Key-Value Cache)将之前token的Key和Value向量存储在GPU显存中,避免重复计算。对于Prompt缓存而言,原理类似但作用于请求间复用:当多个请求共享相同的前缀(如系统提示词),服务器可以将该前缀的KV缓存保留在显存中,后续请求直接从缓存位置开始计算,跳过已缓存部分的前向传播。这不仅减少了计算量(节省GPU算力),还降低了首token延迟(Time to First Token),对Agent场景中频繁的短间隔请求尤为关键。
这在提供推理服务的厂商中已非常普遍,对Harness尤其重要。因为服务器临时保留KV缓存,能帮那些想最大化利用订阅或API额度的用户省下大量开销。
这也是为什么在Anthropic的定价页面上,会针对Prompt缓存给出不同的价格。Anthropic甚至提供长达1小时的Prompt缓存(以更高价格),让Harness在搭建网站、深度研究这类长任务上节省成本。
从基础设施角度看,Prompt缓存对Anthropic而言可能是笔相当有利可图的生意。一块英伟达H100 GPU的租赁价约为每小时3美元。这块GPU拥有80GB HBM3显存,带宽为3.35TB/s。取决于KV缓存的量化方式(FP16、FP8或INT4),压缩比可达2-4倍,理论上一块H100能装下整个100万上下文窗口的KV缓存。这意味着,即便Anthropic把这100万上下文窗口的「工位」拆成12份、每份存5分钟,单块H100靠Prompt缓存的每小时收入也能达到约70美元,堪称暴利。当然,这里最大的假设是能否把100万上下文塞进单块80GB显存的H100。
至于1小时的缓存写入,由于预留整小时GPU时间成本高昂,作者推测Anthropic可能会把闲置内存从GPU踢到临近的SSD(长期存储更便宜)。NVMe SSD拥有约7GB/s的吞吐量和相对低廉的每GB成本(约0.1美元/月),非常适合作为GPU显存的二级缓存。当缓存再次被需要时,按需重新加载回GPU——这也解释了它为何能提供每百万输入token约10美元的相对低价写入,同时在重新加载时可能引入的额外延迟对于非实时场景是可接受的。
订阅制:把用户圈进「围墙花园」
尽管这些机制很有意思,但普通用户其实并不想在编程时一边工作一边计算成本。厂商留住用户的常见做法,是在模型层提供订阅制,让Harness在订阅额度下使用。
ChatGPT、Claude、Gemini这些前沿应用都提供订阅。这样一来,你就不必在工作中途因为担心Agent到底烧了多少钱而焦虑,只要额度会定期刷新,你就能专注于AI用例本身。

比如Anthropic的Pro计划可能以每月20美元捆绑其全部模型,让用户在Claude Code、Claude Cowork、Claude Chat等多个Harness下自由使用,并可在Opus、Sonnet、Haiku之间切换。OpenAI也一样,ChatGPT Plus订阅可覆盖ChatGPT、Codex等,多个模型共用一套计量体系。
订阅制的商业逻辑本质上是一种「保险模型」:厂商赌的是大多数订阅用户的实际用量远低于重度用户,通过轻度用户的「剩余额度」补贴重度用户的超额消耗,同时通过锁定效应(用户习惯了特定Harness的工作流后切换成本极高)维持用户粘性。这也是为什么它被称为「围墙花园」——一旦你的工作流深度绑定了某个厂商的Harness生态,迁移的隐性成本可能远超显性的订阅费用。
理解成本结构,才能真正省钱
这篇内容最大的价值,在于它把「AI编程为什么这么烧钱」这个模糊的焦虑,拆解成了三个清晰的成本来源:厚重的系统提示词、Agent来回震荡的往返次数、以及是否利用了Prompt缓存。
对于开发者而言,这带来几点实用启示:
- 同样的任务、同样的模型,换一个更轻量的Harness,成本可能相差5到15倍;
- 长任务务必确认所用工具是否启用了Prompt缓存;
- 订阅制虽然省心,但也意味着你被圈进了特定厂商的「围墙花园」;
- 对于成本敏感的团队,可以考虑搭建自定义Harness,精简系统提示词中不必要的工具描述,只保留当前任务所需的最小功能集;
- 监控每次Agent执行的往返次数和总token消耗,建立成本基线,才能识别异常开销。
随着开源模型在排行榜上不断逼近闭源模型,未来「不绑定单一厂商」的灵活订阅方案,或许会成为重度用户对抗「隐形碎钞机」的新选择。理解账单背后的机制,正是每一位AI重度用户在这个时代必须补上的一课。
(注:本文基于单一视频来源整理,部分成本推算为作者的个人估算,实际数字可能因厂商策略而变化。)
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AirTag追踪揭秘:亚马逊疑似销毁珍本书训练AI
404 Media记者用AirTag追踪稀有书籍,发现其被送往亚马逊AI训练设施。调查揭示AI公司可能通过破坏性扫描珍本书获取训练数据,引发版权争议与文化遗产保护讨论。