Unverified50% confidenceBenchmarkExact time
传统推理框架中每个请求的 KV Cache 需预分配等长连续显存,显存利用率通常仅有 20%-40%,PagedAttention 可将其提升到接近 100%
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified传统推理框架为每个请求预分配连续 KV Cache 显存块导致平均浪费率高达 60–80%83% similarUnverified传统KV Cache分配方案因按最大序列长度预分配连续显存块,导致平均显存利用率仅20%-40%79% similarUnverified推理时的KV缓存、激活值缓冲区和中间计算状态会额外占用30%-50%显存75% similarUnverified传统 LLM 推理中因需按最大长度预留显存,KV Cache 的实际利用率通常不到 30%67% similarUnverified输出Token价格通常为输入的4-6倍,源于预填充与解码两阶段的算力差异,解码阶段GPU利用率可能仅为预填充的10-20%65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/544380API
curl https://kongchang.com/api/v1/knowledge/claims/544380MCP
get_claim(id=544380)