豆包千问下线智能体:算力成本如何重塑AI商业边界

一个反常识的产品决策
近期,豆包、千问等国产大模型平台相继下线智能体(Agent)功能,引发行业广泛讨论。表面上看,这是政策监管收紧的结果,但据B站相关UP主的分析,监管只是其中一个因素,真正的核心原因藏在企业内部的数据监控之中——天天使用智能体的用户,绝大多数都是不付费的。
这里有必要理解「智能体」究竟意味着什么样的算力消耗。Agent并非普通的单轮问答,而是一种由「感知-规划-执行」循环构成的自主AI系统架构。这一架构源于经典AI研究中的BDI(信念-欲望-意图)模型,但现代LLM-based Agent将其大幅重构——与传统规则型自动化不同,LLM Agent的规划层依赖大模型的涌现能力(Emergent Capabilities)动态生成执行路径,意味着每一步决策都必须经过完整的神经网络前向传播。目前主流实现范式是ReAct(Reasoning + Acting)框架,它将「思考」和「行动」交织为单一的Token流,使模型在生成下一步行动之前先输出推理过程,进一步增加了每次调用的Token消耗。其核心组件包括:任务规划器(将复杂目标分解为子任务序列)、工具调用层(调用搜索引擎、代码解释器、数据库等外部API)、记忆管理模块(维护短期上下文与长期知识库)以及反馈迭代机制(根据执行结果动态调整计划)。它可以持续与环境交互,搜索网页、调用API、执行代码、管理记忆,直到完成复杂目标。
这种架构的计算开销呈指数级放大,根本原因在于多个成本因素相互叠加:每个子任务都需要独立的模型推理,上下文窗口随任务进展不断累积扩张(大型语言模型处理长上下文时,注意力机制的计算复杂度与序列长度的平方成正比),以及频繁的工具调用引入的网络延迟和API成本。单次Agent任务可能触发数十次模型调用,叠加工具调用的延迟和上下文窗口的扩张,单次任务成本可以是普通对话的数十倍。这正是为什么「娱乐化Agent用户」会成为平台最难承受的群体——他们高频使用、长时交互,却几乎不付费。
这些用户用智能体做什么?大多是陪伴、搞笑、虚拟角色扮演等娱乐化场景。对用户而言,这确实好玩;但对背后的字节、阿里等公司而言,这是一笔无法承受的算力账单。即便是这样体量的巨头,也愿意为此舍弃花了大成本获取的、数以千万计的用户。这个决策本身,就说明问题的严重性远超我们想象。

AI时代的成本结构彻底变了
要理解这个决策,必须看懂AI产品与互联网产品在成本结构上的根本差异。
互联网产品:边际成本趋近于零
以刷抖音为例。你刷两个小时、看一百条视频,抖音为此承担的成本可能只有几分钱。平台随手插入一条广告,就能把这笔钱赚回来,甚至大赚。这是典型的互联网逻辑——内容一旦生产完成,分发的边际成本极低,用户越多、使用越频繁,摊薄后的单次成本越接近于零。
这种「边际成本趋近于零」源于数字内容的复制特性:一段视频编码完成后,无论分发给一人还是一亿人,服务器的增量成本微乎其微,CDN(内容分发网络)的带宽费用也随规模而摊薄。更重要的是,同一份视频文件可以在CDN节点上被无限次缓存和复用,服务器只需存储一份副本便可响应全球请求,这是其规模效应的物理根基。这是互联网广告商业模式能够成立的物理基础,也让「先免费获取用户、再广告变现」的路径在互联网时代屡屡奏效。
AI产品:每次对话都在真金白银地烧钱
AI产品的逻辑完全相反。每次推理(Inference)都需要在GPU集群上执行数十亿次浮点运算,消耗真实的电力和硬件折旧。以GPT-4级别的模型为例,业界估算每百万Token的推理成本在数美元量级。用户与豆包这类产品对话一次,就要消耗掉「好几毛钱」甚至「好几块」的算力成本。这意味着用户用得越多、聊得越嗨,平台亏得越狠。
更关键的是,AI推理的边际成本不趋于零,根本原因在于其计算需求与硬件物理极限直接挂钩。从芯片架构层面理解这一点尤为重要:大型语言模型的推理过程本质上是「内存带宽受限」(Memory Bandwidth Bound)而非「算力受限」(Compute Bound)的任务。生成每个Token时,GPU必须将完整的模型权重从HBM(高带宽显存)读入SRAM进行计算,而非像训练时那样可以通过大批量并行来摊薄内存读取成本。以NVIDIA H100为例,其HBM3显存带宽约为3.35 TB/s,但对于参数量达1750亿的GPT-4级模型,即便以fp8精度存储也需要约175GB显存,单次Token生成的带宽利用率极低——这一物理约束被称为「推理墙」(Inference Wall)。每次推理都需要在GPU显存中加载完整的模型权重,无论用户规模多大,单次请求消耗的算力几乎固定。GPU的显存带宽(Memory Bandwidth)是推理速度的物理瓶颈——每生成一个Token,模型都必须从显存中完整读取一遍所有权重,这一物理过程无法通过增加用户数量来摊薄。相比之下,互联网内容分发依赖CDN缓存,同一内容可被无限次复用;而AI每次生成的输出都是唯一的,无法缓存复用。这一根本差异使得「规模效应」在推理侧远不如在训练侧明显,AI平台无法复制互联网「越大越便宜」的规律,反而面临「越多用户、越多亏损」的线性亏损曲线。
更要命的是变现困境:如果要靠广告收回这笔算力成本,平台得给用户塞多少广告?塞到用户忍无可忍地卸载为止,也未必能覆盖成本。娱乐化、陪聊型的AI应用,本质上是一个「用户越活跃、企业越亏损」的商业模式,这在长期是不可持续的。
值得参照的是,早期云计算行业同样经历了「先烧钱扩规模、再寻找付费场景」的阶段,AWS在2006年推出后数年内持续亏损,直到企业级市场成熟才实现盈利。但AI与云计算的关键差异正在于成本曲线的斜率:云计算的边际成本随规模扩大快速下降(服务器利用率从20%提升到80%会带来显著的单位成本下降),而AI推理受制于「推理墙」,成本曲线下降远比云计算缓慢。这意味着AI公司等待「用规模换利润」的时间窗口更长、资金消耗更大。在此背景下,大厂主动收缩娱乐化Agent功能,与其说是战略撤退,不如理解为一种「主动止血」——将有限算力资源集中于商业转化率更高的专业用户。
从大众娱乐转向专业市场
认清这个成本结构后,大厂的战略调整就顺理成章了。豆包、千问接下来的方向将非常明确:
- 走向专业化知识助手,聚焦能够产生实际价值的场景;
- 放弃虚拟陪聊、情感化服务,因为这类用户不会为算力买单;
- 面向愿意付费的专业市场,让真正需要AI创造价值的人来分摊成本。
这背后的逻辑很朴素:只有当AI帮用户创造了远超算力成本的价值时,付费才会自然发生。陪聊带来的是情绪价值,但情绪价值很难量化成付费意愿;而专业场景——写代码、做分析、跑工作流——带来的是可衡量的效率提升,这才是AI商业化的正路。
这一战略转向在经济学上有清晰的对应逻辑:企业正在主动筛选「高价值用户」,放弃「高成本低收益用户」。在传统互联网时代,这种筛选几乎不必要,因为服务每位用户的边际成本趋近于零;但在AI时代,每位用户的服务成本都是真实且显著的,用户质量(即付费能力与付费意愿)的重要性被大幅提升。

AI编程:最先跑通的付费场景
在所有专业场景中,AI编程(AI Coding)是目前商业化最成熟、价值最直观的方向之一。但它的门槛也不低。
AI编程工具的发展经历了三个阶段:早期的代码补全(以GitHub Copilot为代表,支持行级、函数级补全);中期的对话式编程(以ChatGPT Code Interpreter为代表,支持自然语言描述生成完整代码块);以及当前的自主编程Agent阶段(以Cursor、Codex CLI、Devin为代表,能够理解整个代码仓库、自主规划修改路径、执行测试并迭代)。每个阶段的能力跃升,背后都伴随着成倍增长的算力消耗——从单次补全的毫秒级推理,到跨越整个代码库的多轮规划,再到能够自主运行测试、读取报错并迭代修复的闭环系统,算力需求呈数量级递增。
国外顶级工具的价格壁垒
国外主流的AI编程工具如Claude、Codex,起步价就是每月20美元,而且这只是入门档位——一天可能只能用半小时。想要真正把算力用满、支撑一整天的高强度编程,往往需要充值到每月200美元。
定价高昂的原因在于其背后消耗的是最顶级的推理模型算力,并叠加了大量上下文工程(Context Engineering)——这是当前自主编程Agent阶段的核心技术挑战,指如何在有限的Token窗口内高效组织项目信息。这一挑战的复杂性远超表面所见:大型代码仓库可能包含数百万行代码,而主流模型还存在「Lost in the Middle」现象——模型对上下文中间部分的注意力显著弱于首尾,使得有效可用的上下文容量远小于名义窗口大小。编程Agent需要综合运用多种检索策略:基于向量嵌入的语义检索(Semantic Search)用于找到功能相似的代码片段,基于BM25的词频检索用于精确匹配函数名和变量名,以及代码检索增强(RAG)、抽象语法树分析(AST)、依赖图谱构建等技术,智能筛选出与当前任务最相关的代码片段送入模型,同时维护跨会话的项目记忆。
其中,抽象语法树(AST)分析是理解代码语义结构的关键手段:AST将源代码解析为树形数据结构,使AI能够理解函数调用关系、变量作用域和类继承层级,而非仅仅将代码视为文本字符串。依赖图谱(Dependency Graph)则记录了模块间的引用关系,帮助Agent判断修改某个文件可能影响哪些下游组件,从而在规划修改路径时避免引入意料之外的副作用。这套复杂的工程体系正是Cursor、Devin等顶级工具核心竞争力所在,也是其高定价的底层支撑。
对不差钱的少数人来说,这几百上千不算什么;但对费用敏感的中小企业和个人开发者而言,这是一道实实在在的门槛。他们至今没能体会到AI编程带来的效率革命,很大程度上就是被成本挡在了门外。

「拼多多版Codex」的思路
针对这一痛点,有创业者推出了定位为「拼多多版Codex」的AI编程平台——以更低的价格提供接近顶级工具的编程体验。通过在基础模型之上做大量Agent优化,力图实现不输Codex的编程效果,同时将价格压低到国外产品之下。
需要说明的是,「价格下探」不仅是商业策略,更需要在技术层面有真实突破。模型蒸馏(Model Distillation)是其中的关键路径之一——用大型教师模型(如GPT-4、Claude 3.5)的输出作为训练信号,指导小型学生模型学习复杂推理能力,从而在参数量缩减数倍的情况下保留大部分性能。蒸馏的核心原理在于:教师模型输出的概率分布(Soft Labels)包含了比人工标注(Hard Labels)更丰富的语义信息——例如模型认为「这段代码是Python函数」的同时也以30%的概率认为它可能是类方法,这种细粒度的不确定性信号对学生模型的训练极为宝贵。在AI编程场景中,蒸馏策略通常针对特定任务类型(如Python代码生成、SQL查询、前端组件编写)进行领域专项优化,使小模型在垂直场景中的表现接近通用大模型。此外,KV缓存复用技术可以在相似编程任务中重用已计算的中间结果,进一步降低推理成本。这两项技术的结合,使得平价AI编程服务在理论上具备可行性——但若缺乏这些技术层面的真实突破,低价只是补贴而非可持续的商业模式。此类效果宣称来自单一渠道且带有推广性质,读者应理性评估。但其揭示的市场痛点是真实的:AI编程工具的性价比,正在成为中小开发者选型的核心考量。
AI编程正在重塑工作流
抛开产品推广,一线开发者的实践案例更值得关注。写了十几年代码的开发者表示,最近几个月已经「一行代码都不写」,完全依赖AI Coding:
- 销售环节:让AI开发自动挖掘高意向用户的工作流,提升触达效率;
- 运营环节:让AI开发自动剪辑、自动出视频的工具,替代低效的人工操作。
关键在于,这些改造「不需要动技术,完全用自然语言对话」就能完成。这背后是大模型在代码生成领域的一个关键突破,也对应着「Vibe Coding」(氛围编程)这一新兴范式——该概念由OpenAI联合创始人Andrej Karpathy于2025年初提出,描述的是以自然语言意图驱动、由AI全程生成代码的编程方式。
其技术基础在于现代代码生成模型不仅训练于GitHub等平台的海量代码语料(GitHub Copilot的训练数据超过5400亿Token),还通过强化学习(RLHF/RLAIF)优化了将自然语言需求映射为可执行代码的能力。具体而言,RLHF(基于人类反馈的强化学习)通过让模型生成多个候选代码方案、由人类工程师评分排序,再以此信号训练奖励模型,最终将「代码能跑通且符合需求」这一人类判断内化为模型的优化目标,将业务意图(Intent)与实现细节(Implementation)之间的翻译成本降低到接近于零。传统软件开发中,业务人员需要将需求转化为产品文档,产品经理再转化为技术规格,开发者最终写成代码——每次转译都有信息损耗和沟通成本。而当AI能够直接理解自然语言描述并生成可运行代码时,这条链路被大幅压缩。
Vibe Coding的深层意义在于它改变了「软件生产的生产关系」。传统软件开发存在严格的知识壁垒:即便是最简单的业务自动化需求,也需要理解数据结构、调用栈、异常处理等计算机科学概念,将「能描述需求的人」和「能实现需求的人」长期分隔为两个职业群体。当AI消解这道壁垒时,业务专家第一次获得了直接将想法物化为软件工具的能力——这在经济学上类似于「去中介化」(Disintermediation),正如电商平台压缩了生产者与消费者之间的流通层级,AI编程工具正在压缩业务需求与软件实现之间的翻译层级。
值得注意的是,Vibe Coding目前仍有明显边界:在需要深度系统设计、性能调优或复杂调试的场景中,AI生成的代码往往存在隐藏的架构问题,需要有经验的工程师把关。常见问题包括:生成的代码缺乏对并发安全的考量、在大数据量下存在性能瓶颈、或引入了难以追踪的隐式依赖。因此,它目前更适合原型开发、脚本自动化、业务流程改造等对代码质量要求相对宽松的场景。但即便如此,它的颠覆性不在于让程序员更快,而在于让非程序员也能参与软件生产,从根本上扩大了AI编程工具的潜在用户市场边界。
这代表了AI编程的一个重要趋势——它不再只是程序员的专属工具,而是普通职场人和企业主改造业务流程的通用手段。

算力成本决定AI的商业边界
豆包、千问下线智能体这件事,给整个行业上了一课:AI产品的商业逻辑,最终受制于算力成本这条硬约束。娱乐化、免费化的大众应用看似热闹,却难以为继;只有能创造可量化价值、让用户愿意付费的专业场景,才能真正跑通商业闭环。
从更宏观的视角看,这场调整也预示着AI行业即将进入一个「精耕细作」的阶段。此前依靠融资补贴烧算力、以用户规模换估值的逻辑正在失效,能否找到真实的付费场景、构建可持续的收入模型,将成为区分AI公司生死的核心变量。GPU算力成本的下降曲线(参考Nvidia每代GPU性价比提升约2-3倍的历史规律)会为行业带来喘息空间,但在算力成本降至足够低之前,商业模式的清醒认知比技术领先更为关键。
对创业者和企业而言,与其纠结「AI能不能陪聊」,不如思考「AI能帮我省下多少人力、创造多少收入」。对整个行业来说,如何在算力成本下降的曲线中找到可持续的商业模式,仍是接下来几年最关键的命题。
核心要点
- 智能体的算力消耗呈指数级放大:每个子任务独立推理、上下文持续扩张、工具调用叠加延迟,使单次Agent任务成本是普通对话的数十倍;
- AI推理成本存在不可逾越的物理边界:GPU显存带宽是硬约束(即「推理墙」),每次生成内容的唯一性决定了其无法像互联网内容那样缓存复用,规模效应在推理侧远弱于训练侧;
- 娱乐化免费用户是AI平台最难承受的群体:高频长时使用叠加近乎零付费,形成「用户越活跃、企业越亏损」的死亡螺旋;
- AI编程是目前商业化最清晰的专业场景:价值可量化、付费意愿强,且随着Vibe Coding的兴起,潜在用户群体正从专业程序员扩展至普通职场人;
- 平价AI编程工具的可行性依赖真实的技术突破:模型蒸馏、KV缓存复用等技术是「低价≠低质」的底层支撑,缺乏技术壁垒的低价只是不可持续的补贴。
相关推荐

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。

暴雪工会赢得历史性合同:游戏业劳工运动迎来转折点
暴雪娱乐员工成功签订历史性工会合同,成为游戏行业劳工运动的里程碑事件。本文深入分析游戏业长期缺乏工会的结构性原因、微软收购后的态度转变,以及这一先例对整个科技和游戏行业劳工权益的深远影响。

AI产品发布新范式:团队心血与用户社区的双向奔赴
探析AI产品发布中情感叙事与社区驱动增长的新趋势。从一条引发行业关注的推文出发,解读AI团队如何通过真诚投入、开放试用和社区建设,实现产品与用户的双向奔赴,构筑长期竞争壁垒。