[KongchangAI]
ConceptMemory Bandwidth

内存带宽

衡量数据在内存与处理器之间传输速度的指标,单位通常为GB/s,是本地运行大语言模型时decode(解码)阶段的核心性能瓶颈

Core Facts

Timeline (last 90 days)

Sep 25

内存带宽决定权重读取速度并影响生成每个token的延迟,浮点算力(FLOPS)决定矩阵运算速度并影响prefill阶段处理输入提示词的速度

Unverified50%
Sep 25

内存带宽而非算力(FLOPS)是决定本地 LLM 推理速度的核心瓶颈,因为生成每个 token 需将几乎全部模型权重从内存读入计算单元

Unverified50%
Sep 22

移动SoC的内存带宽通常在50至100 GB/s级别,远低于数据中心GPU的数百GB/s

Unverified50%
Sep 22

大模型推理的性能上限往往不取决于芯片的峰值算力(FLOPS),而是取决于内存带宽

Unverified50%
Sep 16

内存带宽是大模型推理延迟的主要瓶颈之一,计算单元往往处于等待数据加载状态,这一现象称为「内存墙」

Unverified50%
Sep 11

选择AI设备时不能只看代际数字,应关注内存带宽和内存容量等实质规格

Unverified50%
Sep 11

本地AI推理速度公式为Token/s ≈ 内存带宽 / 每token需读取的数据量

Unverified50%
Sep 10

本地AI推理速度公式为 Token/s ≈ 内存带宽 / 每token需读取的数据量,大语言模型生成每个token采用自回归方式

Unverified50%
Sep 10

每写出一个token,Mac需要从内存中读取整个模型,因此内存带宽成为推理速度的根本上限

Verified65%

All Facts (9)

Source Articles