Unverified50% confidenceFactExact time
传统 LLM 推理中因需按最大长度预留显存,KV Cache 的实际利用率通常不到 30%
1
Sources
50%
Confidence
Long-term
Relevance
8/11/2026
First Seen
Sources
Related Claims
Unverified传统KV Cache分配方案因按最大序列长度预分配连续显存块,导致平均显存利用率仅20%-40%70% similarUnverifiedLLM新模型的平均评估指标可能优于旧模型,但会在小众关键场景中出现退化68% similarUnverified传统推理框架中每个请求的 KV Cache 需预分配等长连续显存,显存利用率通常仅有 20%-40%,PagedAttention 可将其提升到接近 100%67% similarUnverified如果模型跑BF16训练但DCGM_FI_PROF_PIPE_TENSOR_ACTIVE指标长期低于30%,基本可以断定算力被严重浪费66% similarUnverifiedResearch shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/731311API
curl https://kongchang.com/api/v1/knowledge/claims/731311MCP
get_claim(id=731311)