GPU
GPU(图形处理器,Graphics Processing Unit)是一种专用并行计算处理器,最初设计用于加速计算机图形渲染,通过大量小型计算核心同时处理多任务。其高度并行的架构使其在图形显示、科学计算、深度学习训练与推理、数据处理等领域具有显著性能优势,广泛应用于个人电脑、服务器及数据中心等场景。
核心事实
时间轴 (近 90 天)
GPU内CUDA的并行执行模型分层为Grid、Block、Thread,每个Block共享的Shared Memory比全局显存VRAM快十倍以上但容量通常只有几十KB
GPU上特殊函数单元(SFU)的数量远少于普通CUDA核心或张量核心,当大量线程同时请求超越函数计算时SFU极易成为吞吐瓶颈
GPU 单卡价格远高于普通 CPU 实例,同样的折扣比例在 GPU 上带来的绝对节省金额更为可观
影响 GPU/TPU 计算效率的是维度能否被 8、16、32、64 等整除以利用 Tensor Core 等专用计算单元
现代AI加速器(如GPU/TPU)的热设计功耗动辄数百瓦,在太空中散热成本远高于地面
若底层GPU资产价值出现系统性高估,证券化产品可能成为风险传导的放大器
在构建下一代AI基础设施时,CPU选型将重新回到重要位置,而不应将预算全部倾斜给GPU
纹理资源即使经过压缩,在运行时仍需被解码到内存中供GPU使用,解码会占用主线程时间并推迟首次渲染
传统存储访问路径需要数据多次经过CPU内存中转,消耗CPU周期并在GPU与存储间制造性能鸿沟
若大脑高效性部分源于行波实现的异步、分布式信息路由,神经形态架构在模拟这一机制方面可能比传统同步时钟驱动的GPU计算更具优势
还有 40 条时间轴事件
全部知识事实 (20)
连续批处理允许在任意迭代步插入新请求、移除已完成请求,使GPU在每一步保持满负荷运转
90%已验证NVIDIA CUDA于2006年推出,最初是让开发者利用GPU进行通用计算的编程框架
90%已验证大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%已验证训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月
90%已验证NPU是专为AI推理计算设计的硬件加速器,高通骁龙8系列的Hexagon NPU、苹果的Neural Engine、联发科的APU都已集成在移动芯片中
80%已验证GPU的大规模并行计算架构天然适合深度学习中的矩阵运算,其数千个计算核心可将训练过程加速数十倍乃至数百倍
80%已验证TensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力
80%已验证TensorRT的算子融合将计算图中多个连续的小算子合并为一个大算子,减少GPU内核启动次数和中间结果的内存读写;典型融合操作可将卷积、批归一化和激活函数三步合并为单次GPU内核调用
80%已验证训练一个前沿大模型需要投入数亿美元的算力、数据清洗和人力
80%已验证Tensor Core高效运行要求矩阵维度对齐至16或8的倍数
80%已验证大模型推理时实际GPU利用率往往不足10%
80%已验证英伟达长期主导AI训练与推理所需的GPU算力市场
75%已验证大模型推理的瓶颈往往不在算力而在内存带宽,GPU的算力利用率在推理阶段往往不到峰值的10%
75%已验证对于有技术能力的用户,使用vLLM、llama.cpp等工具在自有GPU上完全本地化部署,在长期大规模使用场景下单token成本往往远低于云端付费方案
75%已验证NPU 针对低精度(INT8/FP16)矩阵乘法进行专门优化,在运行量化后的轻量级推理模型时能以 GPU 数分之一的功耗达到相近或更高的吞吐量
75%已验证批处理推理(Batching)将短时间内多个请求合并为一个批次可显著提升GPU吞吐量,但会引入额外排队延迟,需根据延迟容忍度权衡
75%已验证大模型推理本质上是大量矩阵乘法运算,GPU拥有数千个并行计算核心适合这类任务
75%已验证GPU存储层次从快到慢为:寄存器、L1缓存/共享内存、L2缓存、全局显存
75%已验证生成式AI的训练和推理需要大量并行矩阵运算,依赖GPU集群或专用AI芯片持续高负荷运转
75%已验证定制芯片当模型规模和算力需求达到一定量级后,往往能在性能与成本上超越通用GPU
75%