#LLM推理
共 8 篇相关文章

ERRC:用熵再投资压缩张量并行LLM的GPU通信
PyTorch Ambassador Absalam Bande 提出 ERRC(熵再投资残差修正),通过压缩张量并行 LLM 推理中 GPU 间交换的数据,并用节省的空间补偿量化误差,提升跨 GPU 通信效率。本文解析其核心思路与应用价值。

用 Helion 构建高性能可移植的 vLLM 线性后端
本文解析将 Helion 高层 kernel DSL 集成进 vLLM 线性后端的技术实践,探讨如何通过自动调优在提升 LLM 推理性能的同时,用单一通用 kernel 降低实现复杂度并增强跨硬件可移植性。

持久化KV缓存连接器:跨请求与重启复用的LLM推理优化思路
一位开发者在 Reddit 分享了可将 KV 缓存持久化到磁盘、支持跨请求与服务重启复用的 KV connector。本文解析其解决的 LLM 推理痛点、落盘面临的工程挑战以及社区反馈方向。

Nori LLM 突破每秒百万Token:推理引擎的性能极限
Nori LLM 宣称实现每秒超百万 token 的推理吞吐。本文解析这一性能数字背后的连续批处理、KV 缓存优化等技术路径,并探讨吞吐与延迟的权衡以及如何理性评估此类 LLM 推理性能声明。

AIPerf:NVIDIA大规模LLM推理性能基准测试工具解析
NVIDIA推出的AIPerf是一款面向大规模LLM推理的性能基准测试工具。本文解析为何单发请求无法评估真实性能,以及吞吐量、TTFT、ITL等关键指标在生产环境中的意义。
教程攻略AMD GPU部署PD分离式SGLang多节点推理集群教程
详解如何在AMD GPU上部署PD分离式SGLang推理集群,通过单一配置文件实现Prefill-Decode解耦的多节点部署,提升大模型推理吞吐量与延迟表现,附架构原理与适用场景分析。
行业洞察NVIDIA Blackwell创下金融LLM推理STAC-AI新纪录
NVIDIA Blackwell架构GPU在金融行业权威基准STAC-AI中刷新LLM推理性能纪录。深入解析Blackwell架构优势、TensorRT-LLM软硬件协同优化策略,以及大语言模型在金融交易情绪分析、风控合规等场景的应用前景。
深度解读LLM推理能力演进:从思维链到DeepSeek-R1全解析
系统梳理LLM推理能力的技术演进路线,涵盖Chain-of-Thought思维链、Tree-of-Thought、OpenAI o1与DeepSeek-R1推理模型的核心原理与差异,解读开源项目Awesome-LLM-Reasoning的研究趋势洞察。