共 2 篇相关文章
深入解析vLLM推理框架的核心原理:从吞吐(tokens/s)的本质含义,到自回归生成的性能瓶颈,再到KV Cache、PagedAttention、连续批处理三大优化技术,帮助算法工程师系统掌握大模型推理优化知识体系。
全面解析GitHub 16万星的Hugging Face Transformers框架,从核心架构、多模态模型支持到大模型量化推理优化,帮助开发者快速掌握预训练模型的加载、微调与高效部署。