GPU
GPU(图形处理器,Graphics Processing Unit)是一种专用并行计算处理器,最初设计用于加速计算机图形渲染,通过大量小型计算核心同时处理多任务。其高度并行的架构使其在图形显示、科学计算、深度学习训练与推理、数据处理等领域具有显著性能优势,广泛应用于个人电脑、服务器及数据中心等场景。
Core Facts
Timeline (last 90 days)
模型体积越大通常能力越强,而模型大小受限于GPU资源;7B、8B乃至4B这类较小模型往往单张显卡就能运行
重负载agent任务会持续占用推理槽位数秒乃至数十秒,对GPU显存和KV Cache的压力远高于短对话
GPU 专家权重缓存通常采用类似 LRU(最近最少使用)的替换策略,优先保留近期被频繁调用的专家权重
GPU 缓存可利用 MoE 推理中专家激活的局部性特征,命中缓存后无需再次通过 PCIe 从主机内存搬运数据,从而提升吞吐
矩阵-向量乘法等一阶方法运算天然适合在 GPU 上并行执行,而内点法依赖矩阵分解难以利用 GPU 大规模并行能力
AI工厂将GPU、CPU、交换机、DPU、SuperNIC等硬件与调度器、编排系统和软件堆栈紧密耦合在一起
GPU加速管线可以通过增加GPU资源来线性提升处理能力,而不必重构整个软件架构
CPU拥有少量但功能强大的通用计算核心擅长串行逻辑,而现代GPU拥有数千乃至数万个相对简单的并行计算单元
图像处理涉及大量可并行的像素级运算(如本底扣除、坏点修正、特征提取与降噪),这类任务是GPU的强项
传统架构中GPU完成计算后需与其他节点交换数据时必须将控制权交回CPU,CPU负责准备网络描述符、触发传输、轮询完成状态,引入显著延迟
40 more timeline events
All Facts (20)
连续批处理允许在任意迭代步插入新请求、移除已完成请求,使GPU在每一步保持满负荷运转
90%VerifiedNVIDIA CUDA于2006年推出,最初是让开发者利用GPU进行通用计算的编程框架
90%Verified大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%Verified训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月
90%VerifiedNPU是专为AI推理计算设计的硬件加速器,高通骁龙8系列的Hexagon NPU、苹果的Neural Engine、联发科的APU都已集成在移动芯片中
80%Verified大模型推理时实际GPU利用率往往不足10%
80%VerifiedGPU的大规模并行计算架构天然适合深度学习中的矩阵运算,其数千个计算核心可将训练过程加速数十倍乃至数百倍
80%VerifiedTensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力
80%VerifiedTensorRT的算子融合将计算图中多个连续的小算子合并为一个大算子,减少GPU内核启动次数和中间结果的内存读写;典型融合操作可将卷积、批归一化和激活函数三步合并为单次GPU内核调用
80%Verified训练一个前沿大模型需要投入数亿美元的算力、数据清洗和人力
80%VerifiedTensor Core高效运行要求矩阵维度对齐至16或8的倍数
80%Verified英伟达长期主导AI训练与推理所需的GPU算力市场
75%Verified大模型推理的瓶颈往往不在算力而在内存带宽,GPU的算力利用率在推理阶段往往不到峰值的10%
75%Verified对于有技术能力的用户,使用vLLM、llama.cpp等工具在自有GPU上完全本地化部署,在长期大规模使用场景下单token成本往往远低于云端付费方案
75%VerifiedNPU 针对低精度(INT8/FP16)矩阵乘法进行专门优化,在运行量化后的轻量级推理模型时能以 GPU 数分之一的功耗达到相近或更高的吞吐量
75%Verified批处理推理(Batching)将短时间内多个请求合并为一个批次可显著提升GPU吞吐量,但会引入额外排队延迟,需根据延迟容忍度权衡
75%Verified大模型推理本质上是大量矩阵乘法运算,GPU拥有数千个并行计算核心适合这类任务
75%VerifiedGPU存储层次从快到慢为:寄存器、L1缓存/共享内存、L2缓存、全局显存
75%Verified生成式AI的训练和推理需要大量并行矩阵运算,依赖GPU集群或专用AI芯片持续高负荷运转
75%Verified定制芯片当模型规模和算力需求达到一定量级后,往往能在性能与成本上超越通用GPU
75%