Unverified50% confidenceFactExact time
num_ctx 参数直接影响内存占用,KV缓存需要为每个上下文token存储注意力计算的中间状态
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
Mac本地AI编程代理实战:Ollama+OpenCode+MCP完整搭建指南
redditr/ollama7/11/2026
Related Claims
Unverified记忆在LLM系统中会在显式存储层、摘要层、上下文缓存层和间接推理层等多个层面留下痕迹,形成记忆残影71% similarVerified多头潜在注意力机制(MLA)通过将KV投影到低维潜在空间压缩存储,将KV Cache显存占用降低至传统方法的5%至13%67% similarUnverified传统KV缓存实现预先分配最大长度连续显存块,导致平均60%-80%的预分配内存被浪费65% similarUnverifiedNumPy默认采用行优先(C-order)内存存储65% similarUnverified在vLLM中,每个内存页通常存储固定数量Token的KV向量(例如16个),允许不同请求的KV Cache非连续地存储在物理内存中65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/490101API
curl https://kongchang.com/api/v1/knowledge/claims/490101MCP
get_claim(id=490101)