[控场AI]
概念本地推理 / 本地大模型推理 / On-device inference

本地AI推理

在本地硬件(如消费级GPU)上运行AI大模型进行推理的方式,无需依赖云端API,数据不出本地,但受硬件性能限制,总拥有成本包含电费、硬件折旧等多项因素

时间轴 (近 90 天)

10月1日

本地运行大模型的成本以时间(每小时电费)衡量,而云端API成本以吞吐量(每百万token)衡量,两者需换算到同一基准才能公平对比

待验证50%
10月1日

以70 tokens/秒估算,一小时可生成约2.52亿token,折算后每百万token电费成本约为0.48欧元

待验证50%
10月1日

对高频、长时间、持续满载负载的使用场景,本地推理的边际电费优势会显现

待验证50%
9月25日

本地 AI 推理与云端推理的本质区别在于计算发生的位置:云端需要将提示词和上下文数据发送至远程服务器由服务商 GPU 完成运算,本地推理则把模型权重下载到用户设备并在本机完成前向传播

待验证50%

全部知识事实 (4)

来源文章