#大模型推理
共 32 篇相关文章

从1块3090到20台DGX Spark:本地大模型玩家的硬件进化史
一位Reddit用户记录了从单块RTX 3090到20台NVIDIA DGX Spark的本地大模型部署进化史,涵盖MoE内存卸载、多卡功耗瓶颈、保险丝跳闸,以及如何在家用集群上跑通Kimi K3等万亿参数开源模型。

Torch-TPU:让SGLang与vLLM原生跑在TPU上
Google 与 Meta 在 PyTorch 大会介绍 Torch-TPU:一个 PyTorch 原生 TPU 后端,让 SGLang 和 vLLM 推理引擎原生运行在 TPU 上,保留调度器、批处理与服务 API,实现模型与新特性零成本流转。

IQuest-Q1 深度解析:320B MoE 模型如何重塑智能编程
IQuest-Q1 是面向智能编程的 320B MoE 模型,15B 激活参数、256 专家、512K 超长上下文,并在 vLLM 上获得 day-0 支持。本文深度解析其混合 KV 缓存、sink attention 与 EAGLE 推测解码等关键技术。

vLLM 发布 v0.31.0:为 Transformers 版本设置上限约束
vLLM 发布 v0.31.0 版本,核心改动是在依赖项中为 Transformers 库添加版本上限约束,提升兼容性与部署稳定性。本文解析该改动的技术动机与对使用者的实际影响。

SGLang v0.5.21 发布:PD 角色热切换与 Rust 前缀缓存
SGLang v0.5.21 正式发布,汇集 227 位贡献者的 779 个 PR,带来 PD 实例运行时角色热切换、Rust 前缀缓存默认启用、新增 Decisions/Score 判别类 API,以及投机解码与多模型加速等重磅更新。

vLLM v0.31.0rc4 发布:修复MTP在FULL图下的问题
vLLM 发布 v0.31.0rc4 候选版本,重点修复 MTP 多 token 预测在 FULL CUDA 图模式下的接受率崩溃问题。本文解读该版本的核心变更、技术背景及升级建议。

更多程序还是更多重复?拆解LLM Harness的覆盖率与专业化
arXiv新研究通过受控实验拆解LLM harness的答案覆盖率与专业化收益,发现重复执行贡献2.16个百分点,而生成程序的可重复模式主要暴露持续弱点。文章解读其评估方法与对AI推理框架的启示。

昇腾950PR单卡推理DeepSeek V4-Flash实测:208 TPS并已开源
华为昇腾950PR单卡实测运行裁剪版DeepSeek V4-Flash,128GB显存下解码峰值达208 TPS,支持800K上下文,并已开源。本文解析显存分配、MXFP4/8精度测试与Agent自动适配等关键细节。

AI MAX+ 395部署Qwen3大模型:GFX1151引擎实测优化解析
B站UP主防暴键盘更新GFX1151 engine引擎,针对AMD AI MAX+ 395平台部署Qwen3大模型。本文解析MOE内核优化、HGN/GGUF双格式支持、分页KV与并发能力及本机实测数据。

显卡涨疯了怎么办?统一内存+独显异构加速部署大模型
RTX 5090和Pro 6000显卡价格翻倍,本地部署大模型成本飙升。本文解析统一内存+独显异构加速开源方案,拆解Prefill与Decode分工原理,实测三条路径数据,4万美元跑DeepSeek V4.1 Flash成本降至五分之一。

百万级上下文窗口的工程挑战:VRAM碎片与动态KV缓存
百万级上下文窗口对大模型推理提出严峻的显存挑战。本文解析VRAM碎片化与动态KV缓存两大工程难题,探讨分页式缓存、显存池、分层卸载等架构应对策略。

vLLM v0.30.0 发布:混合注意力与推测解码全面升级
vLLM v0.30.0 正式发布,带来混合注意力热点路径优化、HiSparse 分层稀疏解码、Model Runner V2 推测解码增强、内容水印与 Fast Start 快速启动等多项更新,并新增多款模型支持。

vLLM v0.30.1rc0发布:新增AMD MI355 NVFP4与MoRI内核支持
vLLM 发布 v0.30.1rc0 候选版本,新增对 AMD MI355 加速卡的 dense NVFP4 量化内核与 MoRI 内核镜像支持,进一步扩展 ROCm 生态下的大模型推理能力。

深入LLM推理:从KV Cache到PD分离的Serving全景解析
深入解析LLM推理与Serving技术栈:涵盖KV Cache原理、Prefill/Decode两阶段计算形态、PagedAttention、PD分离、EP并行、投机解码等核心机制,剖析大模型推理系统的关键工程权衡与优化思路。

DGX Spark部署Qwen3 27B实测:三种模式怎么选
DGX Spark部署Qwen3 27B实测:D-Spark、MPP、D-Flash2三种模式在代码、短聊、长文场景下的吞吐对比。D-Spark代码51.5,D-Flash2长文25.4、16路并发总吞吐227.6,MIT开源可一行Curl调用。

深入理解大模型推理:为什么生成如此之慢,又该如何加速
深入解析大语言模型推理为何内存受限、生成为何缓慢,系统梳理 KV 缓存、GQA、MLA、状态空间模型、扩散模型、量化剪枝与投机解码等推理加速技术,基于斯坦福大模型课程推理讲座。

vLLM v0.30.0 发布:修复 DeepGEMM CUDA 12.9 构建问题
vLLM v0.30.0 正式发布,核心修复 DeepGEMM 在 CUDA 12.9 环境下的发布构建问题(PR #57554)。本文解析该修复的背景、影响及对大模型推理部署用户的升级建议。

递归语言模型如何实现真正推理:跳出分布外泛化困境
一篇 arXiv 新论文提出反直觉观点:限制语言模型的可见范围反而能提升分布外推理能力。递归语言模型通过上下文隔离排除捷径依赖,挑战了经典学习理论中'覆盖正确规则即可学会'的假设。

