Ollama计费故障:DeepSeek-V4.1-Flash模型误计费已修复并退还

Ollama的deepseek-v4.1-flash模型因费率配置错误导致用户超额扣量,官方已自动重置并返还所有受影响用量。
Ollama平台近日确认其托管的deepseek-v4.1-flash模型在数小时内存在计费费率错误,导致部分用户实际消耗的用量配额远超预期。官方已对受影响用户执行自动化补偿:当前套餐用户的月度用量被重置,旧套餐用户的周用量与会话用量被重置,且因错误费率产生的超额消耗已全额返还至账户,用户无需手动申诉。从技术角度看,flash类模型因其高频低延迟调用特性,一旦与更高档位模型的费率发生错配,误差会被快速放大。此次事件规模有限,但再次提示依赖按量付费AI服务的开发者应配置用量告警、定期核对账单,并保留自身调用日志以备不时之需。
事件概述
Ollama平台近日发布公告,承认其托管的 deepseek广告-v4.1-flash 模型在过去数小时内出现计费异常。部分用户对该模型发起的请求被按照错误的费率结算,导致实际用量消耗高于预期。官方在声明中直接致歉:"Sorry about this."(对此我们表示抱歉。)
这类计费故障在按量付费(usage-based pricing)的AI推理服务中并不罕见,但对依赖固定额度的开发者和团队而言,一旦计量出错,可能在短时间内耗尽本应更长时间使用的配额,进而影响正常业务。
受影响用户的补偿措施
Ollama在公告中明确了针对受影响用户的两项处理方案:
- 用量重置:所有相关用户的用量额度已被重置。对于当前套餐用户,重置对象为月度用量;对于此前旧套餐(previous plans)的用户,则重置周用量以及会话(session)用量。
- 超额用量返还:因该模型计费错误而额外消耗的用量,已全部恢复到用户账户中。
换句话说,官方不仅修正了后续的计费费率,还对错误期间产生的额外损耗进行了追溯补偿。用户无需自行申诉或联系客服,系统层面已完成回滚处理。
问题的技术背景
从公告描述看,问题核心在于"incorrect rate"——即错误的计费费率被应用到了特定模型的请求上。在多模型托管平台中,每个模型通常按照其算力成本、参数规模和上下文长度设定不同的单价。当费率配置或计量逻辑出现偏差时,就可能出现按更高费率结算的情况。
deepseek-v4.1-flash 属于轻量、高吞吐定位的"flash"类模型,通常价格较低、调用频繁。这类模型一旦费率被错配为更高档位,短时间内的高频调用会迅速放大误差,这也解释了为何"某些用户"的消耗会明显高于预期。
按量付费(usage-based pricing)模型在AI推理服务中通常以「token」为计量单位:输入token(prompt)和输出token(completion)分别计价,部分平台还会区分缓存命中与未命中的价格。费率表一般以每百万token的美元成本呈现($/1M tokens)。当后端计费系统在模型路由或配置更新时发生映射错误——例如将某个模型ID错误关联到另一个更高价格模型的费率条目——所有经过该路由的请求都会被乘以错误的单价倍数。对于"flash"系列轻量模型,其设计初衷是以极低延迟处理大批量短请求,单次调用token数虽少,但每秒并发请求量可能远超旗舰模型,一旦费率被错配为旗舰模型价格(有时相差5-10倍),累计误差会在数分钟内达到正常消耗数小时的量级。
对开发者的启示
这起事件对使用第三方AI推理服务的开发者提供了几点现实提醒。
关注用量监控
依赖按量计费的服务时,建议开启用量告警与消费上限,避免异常费率或异常调用在无人察觉时快速消耗配额。定期核对账单明细,能更早发现费率与实际调用不匹配的情况。
平台响应能力的价值
Ollama此次在"数小时内"发现并处理问题,并主动进行用量重置和超额返还,属于较为负责任的处理方式。对于评估AI服务供应商而言,除了模型能力和价格,故障发现速度与补偿透明度同样是重要考量。
评估AI推理平台的服务可靠性时,业界常参考SLA(服务级别协议)中的几项指标:MTTD(平均故障发现时间)、MTTR(平均恢复时间)以及事后的RCA(根因分析)透明度。计费类故障尤为特殊——它不影响服务可用性,因此不会触发常规的可用率告警,往往需要依赖用量异常检测或用户反馈才能发现。Ollama此次在数小时内完成发现、修复并主动推送补偿,说明其具备针对计费层的异常监控能力。对于企业用户在选型时,可以将「计费透明度」和「历史故障补偿记录」纳入供应商评估清单,而不仅仅关注模型基准测试分数和API定价。
保留自身记录
虽然本次官方已自动完成补偿,但用户自行留存调用日志和用量截图,仍是应对计费争议的稳妥做法。当自动补偿未能完全覆盖损失时,这些记录能作为申诉依据。
总结判断
本次 Ollama 的计费故障影响范围有限(仅限特定模型、特定时间段),且官方响应迅速、补偿到位。对绝大多数用户而言,无需额外操作即可获得退还。事件本身规模不大,但再次凸显了云端AI推理服务在计量准确性上的敏感度——对以调用量为成本核心的AI应用来说,任何费率偏差都可能被高频请求放大。
相关推荐

从空气中制造汽油:合成燃料为何尚未普及?
合成燃料能用空气中的二氧化碳、水和电力制造汽油、甲烷和火箭推进剂。本文解析萨巴蒂埃反应与费托合成的化学原理、热力学税、碳中和账本,以及合成燃料为何尚未普及、又将如何重塑能源地缘格局。

Router Rumble:用WiFi路由器演示梯度下降为何败给NSGA-II
Router Rumble 是一个开源 Python 项目,通过在模拟房间摆放 WiFi 路由器,直观对比梯度下降与 NSGA-II 进化算法在离散目标函数上的表现,揭示无梯度优化方法的优势。

CSL-Core:给LangChain智能体工具调用加上可验证的安全策略
开源CLI工具CSL-Core为LangChain智能体的每次工具调用加上经Z3验证的安全策略,支持扫描权限、生成策略、log观察模式与CI审计,不改动提示词即可拦截危险操作。