科技巨头转向开源AI模型:智能路由如何大幅削减AI账单

Uber等头部科技公司借助智能模型路由将大部分AI请求切换至开源模型,以大幅削减闭源API成本。
以Uber、Pinterest、Stripe、Coinbase、Ramp和AT&T为代表的知名企业,正通过"智能模型路由"技术将AI请求按复杂度分层,把简单、重复性任务交给低成本开源模型处理,仅将高难度任务保留给昂贵的闭源旗舰模型。这一策略之所以可行,在于Llama、Mistral、DeepSeek等开源模型能力的快速成熟,以及这些头部公司本身具备的大规模调用量、充足工程能力与可分层的业务场景。除降低成本外,自托管开源模型还带来数据隐私、低延迟与降低供应商锁定等附加价值。这一趋势正向传统行业扩散,并对闭源模型厂商形成真实的营收压力,同时进一步推动开源AI生态的正向循环。
从专有模型到开源方案的转向
人工智能的落地成本正在成为企业不得不认真对待的一笔开支。近期,包括 Uber、Pinterest、Stripe、Coinbase、Ramp 以及 AT&T 在内的一批知名科技公司,正通过一个共同的策略大幅削减自身的 AI 账单——放弃部分专有(proprietary)模型,转而采用开源模型,并配合智能模型路由(smart model routing)技术。
这一趋势的背后,是企业对 AI 支出结构日益精细化的管理需求。当大语言模型从实验阶段走向大规模生产环境时,每一次 API 调用的成本都会被放大成一笔可观的支出。对于日活规模巨大的公司而言,模型选择不再只是技术偏好问题,而是直接影响财务报表的经营决策。

为什么企业现在纷纷转向开源模型
过去两年,闭源商业模型(如 GPT 系列、Claude 等)凭借领先的性能占据了企业采购的主流。但随着 Llama、Mistral、Qwen、DeepSeek 等一批高质量开源模型的成熟,开源与闭源之间的能力差距正在快速缩小。
对于大量实际业务场景——例如内容分类、客服问答、信息抽取、代码补全等——开源模型已经能够提供"足够好"的效果,而成本却只是闭源方案的一小部分。
智能模型路由:降本的关键杠杆
真正让这轮成本优化落地的核心手段,是智能模型路由这一工程实践。它的核心思想很直接:并非所有请求都需要用最强、最贵的模型来处理。
路由的工作逻辑
智能路由会根据每个请求的复杂度、任务类型和质量要求,动态地将其分配给最合适的模型:
- 简单任务(如格式化、简短分类、常见问答)交给成本低廉的开源小模型处理;
- 中等复杂度任务分配给中等规模的开源模型;
- 高难度、高价值任务(如复杂推理、关键决策)才调用昂贵的顶级闭源模型。
通过这种分层策略,企业可以把绝大多数请求下沉到低成本模型,只把少量真正需要"重火力"的请求留给旗舰模型。由于生产环境中的请求往往遵循长尾分布——大量简单请求、少量复杂请求——这种路由方式能带来相当可观的整体成本下降。
模型路由的附加价值:不只是省钱
模型路由带来的价值远不止成本层面。将模型部署在自有基础设施上,还意味着:
- 更强的数据隐私控制:敏感数据无需传输至第三方服务器;
- 更低的推理延迟:本地部署减少网络往返时间;
- 降低供应商依赖:避免被单一模型厂商锁定。
对于 Stripe、Coinbase 这类处理敏感金融数据的公司而言,能够在自有环境中运行开源模型,本身就具有合规和安全层面的巨大吸引力。
头部公司的实践样本
此次被点名的这批公司,覆盖了出行、支付、社交、加密货币、企业财务和电信等多个行业,具有相当的代表性。
头部公司率先转型的三大条件
这些公司之所以能率先享受到开源模型带来的红利,与其自身条件密不可分:
- 调用量足够大:只有当 AI 请求量达到一定规模,闭源 API 的成本才会成为痛点,也才值得投入工程资源去搭建路由和自托管体系;
- 工程能力充足:部署、微调和运维开源模型需要成熟的机器学习基础设施团队,这恰恰是这些科技公司的强项;
- 场景可分层:它们的业务中存在大量重复性、模式化的 AI 任务,非常适合用小模型批量处理。
值得特别关注的是,AT&T 这样的传统电信企业也出现在了名单中。这释放出一个重要信号:开源 AI 的降本逻辑,正在从纯粹的互联网科技公司向更传统的行业快速扩散。
对行业格局的深远影响
这一波"去专有化"的趋势,可能会对整个 AI 供应链产生深远影响。
闭源模型厂商面临的营收压力
当越来越多的高价值客户开始把大部分工作负载迁移到开源模型上,闭源模型厂商将面临真实的营收压力。它们要么在性能上继续保持难以替代的领先优势,要么在定价上做出让步,否则很难留住那些既有工程能力又对成本敏感的大客户。
开源AI生态的正向循环
反过来,头部企业的大规模采用会进一步推动开源模型生态的繁荣。企业级的使用会带来更多的反馈、微调数据和工具链贡献,形成正向循环。模型路由、推理优化、模型托管等中间层的工具和服务,也将迎来更大的市场空间。
普通企业如何借鉴这一策略
对于尚未开始优化 AI 成本的企业来说,这些头部公司的实践提供了清晰的路径参考:
- 先做请求分析:了解自己的 AI 调用中,有多少属于可以用小模型处理的简单任务;
- 引入路由层:不必一次性替换所有模型,可以先在部分场景引入路由,把简单请求分流到开源模型;
- 权衡自托管成本:自托管开源模型虽然省去了 API 费用,但需要算上 GPU 和运维的投入,只有在规模足够时才划算。
需要提醒的是,盲目追随并不可取。对于调用量小、工程资源有限的团队,直接使用闭源 API 反而可能是更经济、更省心的选择。降本的本质是"用合适的模型做合适的事",而不是简单地追求开源或闭源。
结语
Uber、Pinterest、Stripe、Coinbase、Ramp 和 AT&T 的选择,标志着企业 AI 进入了一个更加务实、更注重投入产出比的新阶段。当模型能力普遍提升、开源生态日益成熟,"用最贵的模型解决所有问题"的粗放式做法正在被智能路由驱动的分层策略所取代。这不仅是一次成本优化,更是 AI 从技术炫技走向工程成熟的必经之路。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。