[控场AI]
概念Memory Bandwidth

内存带宽

衡量数据在内存与处理器之间传输速度的指标,单位通常为GB/s,是本地运行大语言模型时decode(解码)阶段的核心性能瓶颈

核心事实

时间轴 (近 90 天)

9月25日

内存带宽决定权重读取速度并影响生成每个token的延迟,浮点算力(FLOPS)决定矩阵运算速度并影响prefill阶段处理输入提示词的速度

待验证50%
9月25日

内存带宽而非算力(FLOPS)是决定本地 LLM 推理速度的核心瓶颈,因为生成每个 token 需将几乎全部模型权重从内存读入计算单元

待验证50%
9月22日

移动SoC的内存带宽通常在50至100 GB/s级别,远低于数据中心GPU的数百GB/s

待验证50%
9月22日

大模型推理的性能上限往往不取决于芯片的峰值算力(FLOPS),而是取决于内存带宽

待验证50%
9月16日

内存带宽是大模型推理延迟的主要瓶颈之一,计算单元往往处于等待数据加载状态,这一现象称为「内存墙」

待验证50%
9月11日

选择AI设备时不能只看代际数字,应关注内存带宽和内存容量等实质规格

待验证50%
9月11日

本地AI推理速度公式为Token/s ≈ 内存带宽 / 每token需读取的数据量

待验证50%
9月10日

本地AI推理速度公式为 Token/s ≈ 内存带宽 / 每token需读取的数据量,大语言模型生成每个token采用自回归方式

待验证50%
9月10日

每写出一个token,Mac需要从内存中读取整个模型,因此内存带宽成为推理速度的根本上限

已验证65%

全部知识事实 (9)

来源文章