NVIDIA
NVIDIA(英伟达)是一家美国半导体和技术公司,主要设计和销售图形处理器(GPU)、系统芯片及相关软件平台。其产品广泛应用于游戏图形渲染、数据中心计算、人工智能训练与推理、自动驾驶及专业可视化等领域。NVIDIA还开发了CUDA并行计算平台,使GPU能够用于通用科学计算,是现代AI基础设施的核心供应商之一。
Core Facts
Timeline (last 90 days)
SpaceX向多家机构寻求400亿美元借款以采购英伟达芯片
NVIDIA 编译器工程师 Güray 介绍了 CUTLASS for Python 的最新进展
CUTLASS Python 是在 CUTLASS 基础上构建的 Python 前端,通过 DSL 和编译器技术让开发者无需直接书写 C++ 模板元编程即可定义高性能内核,最终编译为 CUDA 代码运行在 GPU 上
CUTLASS 是 NVIDIA 于 2017 年开源的 C++ 模板库,面向 GPU 上的高性能线性代数运算
NVIDIA通过Megatron Core引入了位级确定性(Bitwise Determinism)训练能力
Megatron Core是一个广泛使用的开源训练框架
英伟达开源了名为NV-Reason-CT的医学影像模型,能够以原生3D方式读取CT扫描并逐步推理生成放射学报告
GPU 内核特指运行在 GPU 上的并行计算函数,通常以 CUDA(NVIDIA)或 HIP(AMD)等语言编写
内核优化领域常见的参照基线包括 NVIDIA 的 cuBLAS/cuDNN、Google 的 XLA 编译器生成代码以及 Triton 手写内核
AMD GPU 的 wavefront 大小为 64 线程,与 NVIDIA warp 的 32 线程不同
40 more timeline events
All Facts (20)
TensorRT 是 NVIDIA 提供的高性能推理优化引擎,能将 PyTorch/ONNX 模型编译为针对 GPU 优化的执行引擎,通常可将推理速度提升 2-5 倍
90%Verified英伟达H100采用的HBM3内存带宽高达3.35TB/s
90%VerifiedNVFP4是NVIDIA推出的4位浮点(FP4)量化格式,专为Blackwell架构GPU的硬件加速能力设计
90%VerifiedNVIDIA CUDA于2006年推出,最初是让开发者利用GPU进行通用计算的编程框架
90%VerifiedxAI建设了名为Colossus的超级计算集群,据报道配备了超过10万块NVIDIA H100 GPU
90%VerifiedNVIDIA NIM(Inference Microservices)是NVIDIA推出的推理微服务平台,将优化后的AI模型封装为标准化容器镜像,支持在企业本地GPU上一键部署
90%Verified训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月
90%Verified英伟达H100/H200 GPU单卡售价高达3-4万美元
90%VerifiedCUDA(Compute Unified Device Architecture)是NVIDIA推出的并行计算平台
90%Verified英伟达H100/H200系列GPU在AI训练和推理市场占据超过80%的份额
90%VerifiedROCm是AMD面向高性能计算和AI工作负载的开源软件平台,包含HIP编程接口,允许CUDA代码以较低成本移植到AMD GPU
90%VerifiedNVIDIA的CUDA生态是AI推理行业的事实标准
85%VerifiedNVIDIA H100的HBM显存带宽约为3.35 TB/s,在自回归生成任务中利用率往往不足10%
85%VerifiedH100 GPU采用英伟达Hopper架构,单卡峰值算力达3,958 TFLOPS(FP16精度)
85%VerifiedH100 SXM5的HBM3带宽约为3.35TB/s,FP16峰值算力约989TFLOPS
85%Verified美国自2022年起对中国实施先进半导体出口管制,限制高端AI训练芯片如NVIDIA A100/H100及其后续产品的出口
85%VerifiedTensorRT-LLM是NVIDIA推出的推理优化方案,通过算子融合、量化(INT8/FP8)、In-flight Batching等技术实现推理性能优化
85%VerifiedNVIDIA从Volta架构开始引入Tensor Core,这是一种专门用于矩阵乘加运算的硬件单元
85%VerifiedNVIDIA A100、H100系列GPU单卡功耗可达300-700瓦
80%VerifiedCUDA自2006年推出以来已成为AI/深度学习领域事实上的行业标准,PyTorch、TensorFlow等主流框架的默认后端均为CUDA
80%