已验证75% 置信事实精确时间
大模型推理的瓶颈往往不在算力而在内存带宽,GPU的算力利用率在推理阶段往往不到峰值的10%
3
来源数
75%
置信度
长期有效
时效性
2026/9/6
首次发现
来源
涉及实体
相关事实
待验证GPU的SIMD架构在推理阶段面临结构性错配,推理时batch size较小导致算力利用率不足,内存带宽成为核心瓶颈80% 相似待验证当模型参数量超出GPU显存容量时需要offload到系统内存,推理速度会从数十Token/秒骤降至个位数78% 相似待验证自回归推理时batch size通常为1,每个token生成只做一次矩阵-向量乘法,算术强度极低,导致memory-bound问题,单用户场景下GPU利用率往往不到10%77% 相似待验证大模型推理阶段的算力消耗是API成本居高不下的根源,每次请求都需要在GPU集群上完成大量浮点运算,无法通过训练一次反复复用来摊薄成本77% 相似已验证移动端模型推理的速度瓶颈往往不在算力而在内存带宽76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/863321API
curl https://kongchang.com/api/v1/knowledge/claims/863321MCP
get_claim(id=863321)