[控场AI]
概念Flash Attention

FlashAttention

一种通过IO感知的分块计算方式降低Transformer注意力机制显存占用和计算复杂度的技术,是实现超大上下文窗口的关键技术之一

核心事实

时间轴 (近 90 天)

8月24日

许多第三方库如自定义CUDA kernel、FlashAttention等高性能注意力实现不支持MPS

待验证50%
7月17日

FlashAttention通过重新设计注意力计算的内存访问模式,将显存占用从与序列长度平方成正比降低为线性关系

已验证65%

全部知识事实 (2)

来源文章