Unverified50% confidenceFactExact time
vLLM的论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》发表于SOSP 2023
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
vLLM推理框架详解:吞吐优化核心原理与面试攻略
bilibiliAI大模型升升6/9/2026
Related Claims
Verified大语言模型的推理过程本质上是内存带宽受限(memory-bandwidth bound)的任务,每生成一个Token都需要将模型的全部权重从存储中读取一遍67% similarVerified大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务67% similarVerified大语言模型的记忆本质上依赖于Transformer架构的注意力机制,其有效信息容量受限于上下文窗口的token数量67% similarUnverified短期记忆的管理策略包括消息截断(只保留最近N轮对话)和摘要压缩(用LLM将早期对话压缩成摘要)67% similarUnverifiedLlamaFactory supports unified fine-tuning for more than 100 large language models (LLMs) and vision-language models (VLMs)66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489340API
curl https://kongchang.com/api/v1/knowledge/claims/489340MCP
get_claim(id=489340)