概念本地推理 / 本地大模型推理 / On-device inference
本地AI推理
在本地硬件(如消费级GPU)上运行AI大模型进行推理的方式,无需依赖云端API,数据不出本地,但受硬件性能限制,总拥有成本包含电费、硬件折旧等多项因素
时间轴 (近 90 天)
10月1日
本地运行大模型的成本以时间(每小时电费)衡量,而云端API成本以吞吐量(每百万token)衡量,两者需换算到同一基准才能公平对比
待验证50%
10月1日
以70 tokens/秒估算,一小时可生成约2.52亿token,折算后每百万token电费成本约为0.48欧元
待验证50%
10月1日
对高频、长时间、持续满载负载的使用场景,本地推理的边际电费优势会显现
待验证50%
9月25日
本地 AI 推理与云端推理的本质区别在于计算发生的位置:云端需要将提示词和上下文数据发送至远程服务器由服务商 GPU 完成运算,本地推理则把模型权重下载到用户设备并在本机完成前向传播
待验证50%