[控场AI]

#大模型推理

共 32 篇相关文章

KV Cache为何撑爆显存?大模型推理优化全解析
·5 分钟

KV Cache为何撑爆显存?大模型推理优化全解析

长对话导致显存爆炸?本文深入解析KV Cache如何存储历史信息加速推理,为何会撑爆显存,以及PagedAttention、FlashAttention、KV量化等主流优化方案,附大模型面试满分回答模板。

阅读全文 →
vLLM v0.30.0rc1发布:修复FlashInfer BF16自动调优隔离问题
·3 分钟

vLLM v0.30.0rc1发布:修复FlashInfer BF16自动调优隔离问题

vLLM 发布 v0.30.0rc1 候选版本,核心修复为隔离 FlashInfer BF16 自动调优逻辑(PR #57285)。本文解读该修复的技术背景、FlashInfer 与 BF16 调优机制及对推理部署的实际影响。

阅读全文 →
vLLM 集成 Chord 内核:Kimi K2.x 推理加速最高 2.15 倍
·4 分钟

vLLM 集成 Chord 内核:Kimi K2.x 推理加速最高 2.15 倍

vLLM 的 Humming 后端现已支持 Novita Labs 开源的 Chord W4A16 MoE 内核,针对 Kimi K2.x 优化。H200 TP8 加速 1.33 倍,B300 EP8 解码加速最高 2.15 倍,indexed 路径已可用。

阅读全文 →
KV缓存该放在哪?GPU/CPU/SSD分层放置策略实测解析
·5 分钟

KV缓存该放在哪?GPU/CPU/SSD分层放置策略实测解析

一篇arXiv研究通过离散事件模拟器,系统对比GPU/CPU/SSD三级存储下KV缓存的放置策略。结论显示分层可使单GPU并发会话数提升73倍、成本降62倍,但收益主要来自容量而非策略,预取与预测复用被证明得不偿失。

阅读全文 →
校准后再路由:分离式LLM服务的智能请求调度研究
·5 分钟

校准后再路由:分离式LLM服务的智能请求调度研究

arXiv 新论文《Calibrate, Then Route》研究分离式 LLM 服务的学习型请求路由。在八块 A40 GPU 实测中,校准后的路由器取得 0.864 的最高 goodput,并能用六块 GPU 达到轮询七块卡的效果。硬件校准是关键。

阅读全文 →
8卡2080Ti 22G本地部署GLM-5.3-Flash实测:TP2 PP4并行方案解析
·6 分钟

8卡2080Ti 22G本地部署GLM-5.3-Flash实测:TP2 PP4并行方案解析

8卡2080Ti 22G本地部署GLM-5.3-Flash实测:通过TP2 PP4混合并行方案,短文本达30tok/s,33K长文解码18tok/s、预填充180tok/s。深度解析多卡推理的并行策略与推测解码适用性。

阅读全文 →
vLLM Hybrid HiSparse:稀疏MLA破解长上下文显存瓶颈
·6 分钟

vLLM Hybrid HiSparse:稀疏MLA破解长上下文显存瓶颈

vLLM 社区推出 Hybrid HiSparse,基于稀疏 MLA 与分级内存调度,让长上下文请求在显存不足时持续解码。GLM 5.3 实测显示,8×H200 节点上并发请求数从 5-6 提升至 19-25,将集成于 vLLM v0.30。

阅读全文 →
vLLM 黑客松赏金上线:33B 以下开源模型的实战部署较量
·3 分钟

vLLM 黑客松赏金上线:33B 以下开源模型的实战部署较量

NVIDIA 与 Red Hat 联合为 vLLM 增设「最佳应用」赏金,聚焦 33B 以下小型开源模型的真实部署与推理优化。本文解读活动信号、参数上限逻辑及对开发者的实战参考价值。

阅读全文 →
vLLM v0.29.0发布:Model Runner V2成默认引擎,推理性能全面升级
·3 分钟

vLLM v0.29.0发布:Model Runner V2成默认引擎,推理性能全面升级

vLLM v0.29.0正式发布,Model Runner V2成为所有模型的默认引擎。本次更新汇集277位贡献者的594次提交,涵盖Kimi、DeepSeek模型优化、Mamba前缀缓存、投机解码可观测性及RL权重P2P同步等关键升级。

阅读全文 →
LRU缓存淘汰算法为何难以被超越:KV-Cache论文的盲点
·3 分钟

LRU缓存淘汰算法为何难以被超越:KV-Cache论文的盲点

一篇Hacker News讨论指出,经典LRU缓存淘汰算法远比众多KV-Cache优化论文所暗示的更难被超越。本文剖析基准测试偏差、隐藏工程成本等问题,为大模型推理缓存优化提供审慎视角。

阅读全文 →
GLM 5.1满血旗舰模型实测400 TPS,两分钟从草图到完整应用
产品体验
·5 分钟

GLM 5.1满血旗舰模型实测400 TPS,两分钟从草图到完整应用

实测智谱GLM 5.1 High Speed API,满血旗舰模型输出速度达400 Token/s。从草图还原页面到零基础生成完整解谜游戏,验证速度与能力兼得的AI编程新体验。

阅读全文 →
微软Tutel:MoE模型加速库深度解析,支持FP4/FP8低精度计算
深度解读
·8 分钟

微软Tutel:MoE模型加速库深度解析,支持FP4/FP8低精度计算

深度解析微软开源Tutel MoE优化库,支持FP8、NVFP4、MXFP4多精度计算,适配DeepSeek、Kimi-K2、Qwen3等主流MoE模型,解决All-to-All通信瓶颈与显存管理难题。

阅读全文 →