Unverified50% confidenceFactExact time
LLM解码过程是内存带宽受限(memory bound)的,GPU在逐token生成时大部分时间处于等待数据搬运的状态
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
UnverifiedLLM推理的Prefill阶段为计算密集型且GPU利用率接近100%,Decode阶段为内存带宽密集型,瓶颈在于HBM显存带宽74% similarUnverified传统GPU如NVIDIA A100/H100在推理阶段面临内存带宽瓶颈,模型权重需要在每次生成Token时从显存反复读取73% similarUnverifiedGPU的SM能同时驻留的Warp数量决定了GPU隐藏内存访问延迟的能力,制约Occupancy的核心资源是寄存器文件与共享内存73% similarUnverifiedGPU存储层次从快到慢为:寄存器、L1缓存/共享内存、L2缓存、全局显存72% similarUnverified传统AI芯片(GPU或TPU)将模型权重存储在内存中,计算单元按需读取执行,大量时间和能耗消耗在权重搬运上72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/527127API
curl https://kongchang.com/api/v1/knowledge/claims/527127MCP
get_claim(id=527127)