待验证50% 置信事实精确时间
LLM解码过程是内存带宽受限(memory bound)的,GPU在逐token生成时大部分时间处于等待数据搬运的状态
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
待验证LLM推理的Prefill阶段为计算密集型且GPU利用率接近100%,Decode阶段为内存带宽密集型,瓶颈在于HBM显存带宽74% 相似待验证传统GPU如NVIDIA A100/H100在推理阶段面临内存带宽瓶颈,模型权重需要在每次生成Token时从显存反复读取73% 相似待验证GPU的SM能同时驻留的Warp数量决定了GPU隐藏内存访问延迟的能力,制约Occupancy的核心资源是寄存器文件与共享内存73% 相似待验证GPU存储层次从快到慢为:寄存器、L1缓存/共享内存、L2缓存、全局显存72% 相似待验证传统AI芯片(GPU或TPU)将模型权重存储在内存中,计算单元按需读取执行,大量时间和能耗消耗在权重搬运上72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/527127API
curl https://kongchang.com/api/v1/knowledge/claims/527127MCP
get_claim(id=527127)