Unverified50% confidenceFactExact time
分层存储卸载offloading实践在llama.cpp、DeepSpeed-Inference等工具中已有类似应用
1
Sources
50%
Confidence
Long-term
Relevance
8/27/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedDeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍70% similarUnverifiedomlx的SSD缓存机制允许将部分模型权重或KV缓存卸载到高速固态硬盘,从而在有限内存下运行更大的模型或支持更长的上下文70% similarUnverified上下文压缩的常见方法包括基于摘要的压缩、选择性保留和分层记忆68% similarUnverifiedvLLM引入PagedAttention技术将KV Cache分割为固定大小物理块按需分配,而llama.cpp采用预分配策略在模型加载时一次性保留完整KV Cache空间68% similarUnverifiedllama.cpp采用预分配策略,在模型加载时一次性保留完整KV Cache空间,需通过--ctx-size参数指定最大上下文长度67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/807809API
curl https://kongchang.com/api/v1/knowledge/claims/807809MCP
get_claim(id=807809)