概念CSA / HCA / Compressed Shared Attention
混合压缩注意力
混合压缩注意力是一种针对Transformer模型的注意力机制设计方案,结合了压缩共享注意力(CSA)与混合压缩注意力(HCA)两种变体。其核心思路是对KV Cache(键值缓存)进行高效压缩与共享,在保持模型推理质量的同时,显著降低长上下文场景下的显存占用与计算开销,适用于大语言模型的高效推理优化。
混合压缩注意力是一种针对Transformer模型的注意力机制设计方案,结合了压缩共享注意力(CSA)与混合压缩注意力(HCA)两种变体。其核心思路是对KV Cache(键值缓存)进行高效压缩与共享,在保持模型推理质量的同时,显著降低长上下文场景下的显存占用与计算开销,适用于大语言模型的高效推理优化。