FlashInfer是一个面向大语言模型推理的高性能算子库(Kernel Library),专为GPU加速推理场景设计。它提供针对注意力机制(Attention)等核心计算的优化内核实现,支持多种推理框架集成,旨在提升大模型推理吞吐量与计算效率,广泛应用于LLM服务部署与推理系统优化领域。