[控场AI]
产品

FlexGen

大模型推理吞吐量优化系统,支持将模型权重和KV缓存卸载至CPU DRAM及SSD,以低成本硬件运行大规模语言模型

时间轴 (近 90 天)

9月16日

Mooncake、LMCache、FlexGen、InfiniGen、AttentionStore等系统尝试用CPU DRAM和SSD扩展GPU显存容量

待验证50%

全部知识事实 (1)

来源文章