模型路由省钱陷阱:重试成本如何吞噬你的降本收益

一个看似聪明的省钱策略
在构建大规模 LLM 应用时,「模型路由」几乎成了降本增效的标配思路:把简单请求交给小模型处理,把复杂请求留给大模型。逻辑很直观——大部分日常请求并不需要顶级模型的能力,用更小、更便宜的模型就能搞定,从而显著压低整体推理成本。
模型路由(Model Routing)是 LLM 应用架构中一种日益成熟的中间层设计模式。其核心思想是在用户请求与模型推理之间插入一个「路由器」组件,该组件通常基于分类器、嵌入相似度或启发式规则来评估请求的复杂度,进而决定将请求分发到不同规模的模型。例如,OpenAI 的 GPT-4o-mini 与 GPT-4o 之间的价格差距可达 10-30 倍,如果 70% 的日常请求都能由小模型胜任,理论上的成本节约非常可观。这一模式的兴起与 2023-2024 年间大量开源小模型(如 Mistral 7B、Llama 3 8B 等)的涌现密切相关——它们在特定任务上的表现已经足够好,使得分层路由在工程上变得可行。
然而,一位 Reddit 开发者分享的真实案例揭示了这套策略背后隐藏的坑:平均成本确实下降了,但 p95 尾部成本却不降反升。 这个反直觉的结果,值得每一个正在做模型路由的团队警惕。

平均值撒了谎:重试成本的隐藏代价
问题的核心在于「重试成本」(retry cost)。这位开发者描述了一个典型的失败链路:
从路由器生成的请求是发往小模型的简单请求,平均成本下降了,但 p95 成本上升了。大多数低置信度的请求会先在小模型上执行一次,重放相同的上下文,然后回退到大模型进行第二次生成。
换句话说,路由器对某些请求判断为「低置信度」时,实际发生的不是「小模型 or 大模型」的二选一,而是「小模型 + 大模型」的串行叠加。这些请求先在小模型上跑一遍失败,再把完全相同的上下文重新喂给大模型再跑一遍。
这里需要理解路由器中「置信度」的工程含义。置信度通常指路由决策模型对其分类结果的确信程度,常见实现方式包括:使用轻量级分类器对请求打分(如 logistic regression 输出概率)、利用嵌入空间中与已知模式的距离来度量、或者让小模型先生成然后通过自评估(self-evaluation)判断输出质量。当置信度低于设定阈值时,系统会触发回退(fallback)机制。问题在于,大多数回退实现采用的是「先尝试再放弃」的串行策略,而非「预判后直接路由」的策略。更先进的做法是引入投机执行(speculative execution),即同时向大小模型发送请求,取小模型结果如果质量达标则丢弃大模型结果——但这会带来额外的计算资源浪费,只在延迟极度敏感的场景中才值得考虑。
结果就是:这类请求付出了两次生成的代价,而且第二次还是最贵的大模型。平均成本被大量成功的简单请求拉低,掩盖了这批「双重付费」请求的高昂尾部成本。 这正是为什么 p95(第95百分位)成本会飙升——它精准地捕捉到了那些最糟糕的路由决策。
为什么平均值会误导人
这是可观测性领域的经典教训。当你只盯着一个聚合指标(如平均成本)时,很容易对系统的真实健康状况产生错觉。分布的长尾往往才是问题所在,而平均值恰恰会把长尾稀释掉。对于成本敏感的 LLM 生产系统,p95、p99 这类分位数指标远比平均值更有诊断价值。
p95(第95百分位数)是统计学中衡量分布尾部特征的常用指标,意味着 95% 的观测值都低于该数值。在系统可观测性领域,p95 和 p99 延迟是比平均延迟更被推崇的监控指标,因为它们揭示的是用户在最差情况下的真实体验。这一理念最早由 Amazon 在其内部服务治理中推广——Jeff Bezos 曾要求团队关注 p99.9 延迟而非平均延迟,因为受影响最严重的往往是购物车最满、订单最复杂的高价值客户。将这一思路迁移到 LLM 成本管理中,p95 成本能精确暴露那些路由决策最失败的 5% 请求,而这些请求可能占据了总成本中不成比例的高额份额。
用可观测性拆解成本归因
这位开发者借助 Braintrust 这类评估平台,做了几件关键的事情:
- 按意图(intent)拆分 token 归因和成本:不再看整体的一个数字,而是弄清楚每一类请求各自花了多少钱。
- 聚类昂贵的路由路径:找出哪些意图类别的回退率(fallback rate)特别高,正是它们在制造双重付费。
- 按质量切片对比路由实验:不是用一个笼统的整体质量分来评估,而是分维度看每类请求的质量表现。
Token 归因(Token Attribution)是指将 LLM 消耗的 token 数量和对应成本精确归因到每一次请求、每一个意图类别、甚至每一个用户会话的过程。Braintrust 是一个专注于 LLM 应用评估与可观测性的平台,它允许开发者记录每次模型调用的输入输出 token 数、模型选择、延迟和成本,并支持按自定义维度(如意图类型、用户群体、路由路径)进行切片分析。类似的工具还包括 LangSmith(LangChain 生态)、Helicone、Portkey 等。这类工具的核心价值在于将 LLM 调用从「黑盒消费」转变为「白盒归因」,使团队能够像传统 APM(应用性能管理)监控微服务一样,精细化管理 LLM 的成本结构。
这套方法论的意义在于:它把「模型路由」从一个黑盒决策,变成了一个可测量、可归因、可优化的工程问题。 没有细粒度的成本与质量归因,团队根本无法知道钱到底浪费在了哪里。
有针对性的路由优化策略
拿到归因数据后,优化就变得有的放矢了。开发者做了两处调整:
- 提高高回退率意图的路由阈值:对那些经常从小模型回退到大模型的意图类别,干脆提高判定标准,让它们更容易直接走大模型,避免无谓的第一次尝试。
- 在第二次生成前精简重复的上下文:既然回退不可避免,那就别把冗余的上下文原封不动地再传一遍,减少第二次生成的 token 消耗。
效果是三赢的:
- 成本下降:针对性优化的切片成本降下来了;
- 质量守住:整体输出质量没有退步;
- 延迟改善:因为更少请求需要付两次生成的时间,端到端延迟反而变快了。
天下没有免费的午餐
当然,代价也很明确:更多的边界情况现在会直接走大模型。 这意味着放弃了一部分本可以由小模型省下的成本,换取了尾部延迟和尾部成本的稳定性。这是一个清醒的取舍,而非纯粹的胜利。
三维困境:成本、延迟、质量如何权衡
这位开发者最后抛出的问题,其实是整个 LLM 工程界的共同难题:
当成本、延迟和质量朝着不同方向移动时,你们是怎么选择阈值的?
这三个维度往往互相拉扯:
- 降低路由阈值(更多请求走小模型)→ 平均成本降,但回退增多可能推高尾部成本和延迟;
- 提高路由阈值(更多请求走大模型)→ 尾部指标稳定,但平均成本上升;
- 追求极致质量 → 几乎总是意味着更多大模型调用,成本和延迟双升。
四个可落地的优化原则
结合这个案例,笔者认为选择阈值时可以遵循几个原则:
第一,为不同意图设置不同阈值。 不存在一个全局最优阈值。高回退率的意图应该有更保守的阈值,而小模型表现稳定的意图可以更激进。
第二,把重试成本纳入路由决策的期望值计算。 判断是否走小模型时,不能只看小模型的单次成本,而要计算「小模型成本 × 成功率 +(小模型成本 + 大模型成本)× 回退率」的期望值。当回退率高到一定程度,直接走大模型反而更划算。
从数学角度来看,这本质上是一个期望成本最小化问题。设小模型单次推理成本为 Cs,大模型单次推理成本为 Cl,对某类意图的回退率为 f,则:走小模型的期望成本 = Cs × (1-f) + (Cs + Cl) × f = Cs + Cl × f;直接走大模型的期望成本 = Cl。临界点在于 Cs + Cl × f = Cl,即 f = (Cl - Cs) / Cl。以 GPT-4o-mini(约 $0.15/百万 token)和 GPT-4o(约 $2.5/百万 token)为例,临界回退率约为 94%——看起来很高,但如果将双倍延迟对用户体验的隐性成本也纳入计算,实际可接受的回退率阈值会低得多,通常在 30-40% 左右就值得考虑直接路由到大模型。
第三,用分位数指标而非平均值来做决策护栏。 把 p95 成本、p95 延迟作为不可突破的约束,在此前提下优化平均成本,能有效防止长尾失控。
第四,建立持续的评估闭环。 请求分布会随业务变化而漂移,今天最优的阈值明天可能就失效了。像案例中那样,把路由当作可以反复实验、按质量切片对比的对象,才能长期保持效率。
分布漂移(Distribution Drift)是机器学习系统在生产环境中面临的普遍挑战,指的是实际输入数据的分布随时间偏离训练或调优时的分布。在 LLM 路由场景中,这种漂移可能表现为:新功能上线带来全新的意图类型、用户行为季节性变化导致请求复杂度分布改变、甚至模型提供商的 API 更新导致小模型在某些任务上的表现发生变化。持续评估闭环的工程实践通常包括:定期抽样人工评估路由决策质量、设置自动化的 A/B 实验框架对比不同阈值配置、建立成本和质量的告警机制(如 p95 成本超过基线的 120% 时自动触发审查)。这与 MLOps 中模型监控和再训练的理念一脉相承,只是监控对象从模型预测质量扩展到了路由决策质量。
结语
这个案例最大的启示,不在于「模型路由不好」,而在于任何优化都必须建立在可观测的基础上。模型路由本身是有效的 LLM 降本手段,但如果缺乏细粒度的成本与质量归因,很容易被平均值蒙蔽,在看不见的尾部持续失血。
把系统拆开看、按维度归因、用分位数守护线——这套方法论适用于几乎所有 LLM 生产系统的成本优化。在成本、延迟、质量的三维博弈中,没有银弹,只有基于数据的持续权衡。
相关推荐

一次编程请求耗掉70%额度?AI编程助手Flash模型翻车实录
开发者使用AI编程助手Flash模型提交一个prompt,竟消耗70%配额。本文深入分析token计费、上下文窗口膨胀等原因,并提供控制AI编程成本的实用策略。

语音编码算法评估新框架:Rand指数、不一致度评分与正字法透明度量化
深入解析基于广义Rand指数的语音编码算法评估新方案,涵盖Hüllermeier-Rifqi指数、归一化编辑距离、随机基线校正等核心方法,并探讨其在多语言评测与正字法透明度量化中的创新应用。

EXAONE Finance:专为金融打造的时序预测基础模型深度解析
深度解析LG AI Research发布的EXAONE Finance模型,探讨其如何通过无注意力架构、掩码上下文增强和多资产金融语料三大创新,解决通用时序模型在金融预测中的效率、缺失数据和领域适配难题,并在FinVerse基准上实现全面SOTA。