#模型优化
共 4 篇相关文章

·11 分钟
深入理解大模型推理:为什么生成如此之慢,又该如何加速
深入解析大语言模型推理为何内存受限、生成为何缓慢,系统梳理 KV 缓存、GQA、MLA、状态空间模型、扩散模型、量化剪枝与投机解码等推理加速技术,基于斯坦福大模型课程推理讲座。
阅读全文 →

·6 分钟
用AI Agent做模型创新:从消融实验到涨点的实战教学
B站UP主钱韵实战演示如何用AI Agent(Codex)辅助深度学习模型创新优化,从UNet基线0.817出发,通过训练策略、注意力模块缝合与组合叠加,逐步实现mIoU涨三个点,附完整方法论与提示词技巧。
阅读全文 →
教程攻略·11 分钟
NVIDIA Model Optimizer训练后量化(PTQ)实战指南
深入解析NVIDIA Model Optimizer训练后量化(PTQ)工作流,涵盖INT8/INT4量化原理、校准方法、RTX GPU优化策略及大语言模型量化部署最佳实践,助你在消费级显卡上高效运行大模型。
阅读全文 →
深度解读·8 分钟
微软Tutel:MoE模型加速库深度解析,支持FP4/FP8低精度计算
深度解析微软开源Tutel MoE优化库,支持FP8、NVFP4、MXFP4多精度计算,适配DeepSeek、Kimi-K2、Qwen3等主流MoE模型,解决All-to-All通信瓶颈与显存管理难题。
阅读全文 →