待验证50% 置信事实精确时间
vLLM当前实现存在bug:在前缀缓存中会把最后一个约16 token的缓存块直接丢弃并重新计算,即使请求命中了缓存
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/9/6
首次发现
有效期至:2026/9/20
来源
涉及实体
相关事实
待验证在vLLM中,每个内存页通常存储固定数量Token的KV向量(例如16个),允许不同请求的KV Cache非连续地存储在物理内存中72% 相似待验证前缀缓存通过复用已计算的KV Cache,可节省50%-80%的prefill阶段计算量,vLLM通过基数树结构实现细粒度缓存命中匹配67% 相似待验证硬盘缓存机制将已计算的KV Cache持久化到存储介质中,当后续请求前缀与缓存命中时可直接复用,跳过重复的前向传播66% 相似待验证以LLaMA-2 70B模型为例,2048 token的序列需约4GB显存仅用于KV缓存64% 相似待验证KV Cache(键值缓存)用于避免自回归生成时对历史 token 的重复计算,但长上下文场景下预填充阶段需占用大量 HBM 显存带宽,拉长首 token 延迟(TTFT)63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/863787API
curl https://kongchang.com/api/v1/knowledge/claims/863787MCP
get_claim(id=863787)