#大模型推理
共 32 篇相关文章

KV Cache为何撑爆显存?大模型推理优化全解析
长对话导致显存爆炸?本文深入解析KV Cache如何存储历史信息加速推理,为何会撑爆显存,以及PagedAttention、FlashAttention、KV量化等主流优化方案,附大模型面试满分回答模板。

vLLM v0.30.0rc1发布:修复FlashInfer BF16自动调优隔离问题
vLLM 发布 v0.30.0rc1 候选版本,核心修复为隔离 FlashInfer BF16 自动调优逻辑(PR #57285)。本文解读该修复的技术背景、FlashInfer 与 BF16 调优机制及对推理部署的实际影响。

vLLM 集成 Chord 内核:Kimi K2.x 推理加速最高 2.15 倍
vLLM 的 Humming 后端现已支持 Novita Labs 开源的 Chord W4A16 MoE 内核,针对 Kimi K2.x 优化。H200 TP8 加速 1.33 倍,B300 EP8 解码加速最高 2.15 倍,indexed 路径已可用。

KV缓存该放在哪?GPU/CPU/SSD分层放置策略实测解析
一篇arXiv研究通过离散事件模拟器,系统对比GPU/CPU/SSD三级存储下KV缓存的放置策略。结论显示分层可使单GPU并发会话数提升73倍、成本降62倍,但收益主要来自容量而非策略,预取与预测复用被证明得不偿失。

校准后再路由:分离式LLM服务的智能请求调度研究
arXiv 新论文《Calibrate, Then Route》研究分离式 LLM 服务的学习型请求路由。在八块 A40 GPU 实测中,校准后的路由器取得 0.864 的最高 goodput,并能用六块 GPU 达到轮询七块卡的效果。硬件校准是关键。

8卡2080Ti 22G本地部署GLM-5.3-Flash实测:TP2 PP4并行方案解析
8卡2080Ti 22G本地部署GLM-5.3-Flash实测:通过TP2 PP4混合并行方案,短文本达30tok/s,33K长文解码18tok/s、预填充180tok/s。深度解析多卡推理的并行策略与推测解码适用性。

vLLM Hybrid HiSparse:稀疏MLA破解长上下文显存瓶颈
vLLM 社区推出 Hybrid HiSparse,基于稀疏 MLA 与分级内存调度,让长上下文请求在显存不足时持续解码。GLM 5.3 实测显示,8×H200 节点上并发请求数从 5-6 提升至 19-25,将集成于 vLLM v0.30。

vLLM 黑客松赏金上线:33B 以下开源模型的实战部署较量
NVIDIA 与 Red Hat 联合为 vLLM 增设「最佳应用」赏金,聚焦 33B 以下小型开源模型的真实部署与推理优化。本文解读活动信号、参数上限逻辑及对开发者的实战参考价值。

vLLM v0.29.0发布:Model Runner V2成默认引擎,推理性能全面升级
vLLM v0.29.0正式发布,Model Runner V2成为所有模型的默认引擎。本次更新汇集277位贡献者的594次提交,涵盖Kimi、DeepSeek模型优化、Mamba前缀缓存、投机解码可观测性及RL权重P2P同步等关键升级。

LRU缓存淘汰算法为何难以被超越:KV-Cache论文的盲点
一篇Hacker News讨论指出,经典LRU缓存淘汰算法远比众多KV-Cache优化论文所暗示的更难被超越。本文剖析基准测试偏差、隐藏工程成本等问题,为大模型推理缓存优化提供审慎视角。
产品体验GLM 5.1满血旗舰模型实测400 TPS,两分钟从草图到完整应用
实测智谱GLM 5.1 High Speed API,满血旗舰模型输出速度达400 Token/s。从草图还原页面到零基础生成完整解谜游戏,验证速度与能力兼得的AI编程新体验。
深度解读微软Tutel:MoE模型加速库深度解析,支持FP4/FP8低精度计算
深度解析微软开源Tutel MoE优化库,支持FP8、NVFP4、MXFP4多精度计算,适配DeepSeek、Kimi-K2、Qwen3等主流MoE模型,解决All-to-All通信瓶颈与显存管理难题。