产品
FlexGen
大模型推理吞吐量优化系统,支持将模型权重和KV缓存卸载至CPU DRAM及SSD,以低成本硬件运行大规模语言模型
时间轴 (近 90 天)
9月16日
Mooncake、LMCache、FlexGen、InfiniGen、AttentionStore等系统尝试用CPU DRAM和SSD扩展GPU显存容量
待验证50%
大模型推理吞吐量优化系统,支持将模型权重和KV缓存卸载至CPU DRAM及SSD,以低成本硬件运行大规模语言模型
Mooncake、LMCache、FlexGen、InfiniGen、AttentionStore等系统尝试用CPU DRAM和SSD扩展GPU显存容量