[KongchangAI]
ProductFlash-Attention 2 / flash-attn

Flash-Attention

由Tri Dao等人提出的IO感知精确注意力算法,通过分块计算减少HBM读写,将注意力显存复杂度从O(N²)降至O(N),是Transformer训练与推理的高性能内核标配

Source Articles