Unverified50% confidenceFactExact time
大模型推理阶段是memory-bound(内存带宽受限),每生成一个Token需从显存读取整个模型权重,计算强度极低
1
Sources
50%
Confidence
Long-term
Relevance
8/23/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在自回归生成阶段每生成一个token都需要从内存读取整个模型全部权重,使得生成阶段严重受限于内存带宽而非计算能力(memory-bound)79% similarPartially Verified大模型本质上是无状态的,每次推理时模型只能看到当前输入的Token序列,没有持久化的记忆存储78% similarUnverifiedLLM的记忆依赖于上下文窗口,即模型在单次推理时能够处理的最大Token数量75% similarUnverified大模型推理中每生成一个token都需要从显存中读取全部模型权重,速度瓶颈本质是数据搬运问题而非计算问题75% similarUnverified自回归大模型推理瓶颈并非计算量而是内存带宽,推测解码通过拒绝采样保证输出分布与原始大模型完全一致74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/789729API
curl https://kongchang.com/api/v1/knowledge/claims/789729MCP
get_claim(id=789729)