Unverified50% confidenceFactExact time
对于拥有32层、32头注意力的典型7B模型,每个token需约0.5MB显存存储KV Cache,生成1000个token则需额外约500MB显存
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
扩散语言模型崛起:DiffusionGemma实测速度碾压自回归模型
redditr/GoogleGeminiAI7/11/2026
Related Claims
Unverified数千亿参数模型处理128K上下文窗口时,KV Cache可能占据数十GB显存81% similarUnverified对于一个典型的700亿参数模型,KV缓存每个词元大约占半兆(0.5MB)内存,生成10万个词元需要携带50GB的缓存81% similarUnverifiedKV缓存的显存占用与上下文长度、模型层数和注意力头数成正比,8K上下文下一个典型27B模型可能额外消耗2~4GB显存79% similarUnverified对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存79% similarUnverified支持128K上下文的70B参数模型的KV Cache满负荷时可能需要数百GB显存,超过单张H100的80GB显存容量77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/500846API
curl https://kongchang.com/api/v1/knowledge/claims/500846MCP
get_claim(id=500846)