[控场AI]
产品Radeon Open Compute / ROCm平台

ROCm

AMD推出的开源GPU计算平台,是NVIDIA CUDA生态的开源替代方案,支持主流AI框架,面向大模型训练、推理及AI Agent等场景

核心事实

时间轴 (近 90 天)

10月4日

RCCL(ROCm Collective Communications Library)是AMD为ROCm平台开发的集合通信库,功能上对标NVIDIA的NCCL

待验证50%
10月4日

PyTorch的torch.compile、OpenAI的Triton编译器以及AMD的ROCm平台共同构建了硬件无关的更高抽象层

待验证50%
10月4日

RL-Kernel团队将RL-Align/RL-Kernel与vLLM的相关组件集成,在AMD ROCm平台上实现了训练与推理logprob的逐位(bit for bit)匹配

待验证50%
10月4日

5.18.0 引入了六项破坏性改动,包括 ROCm 平台 gpt-oss 将 FA3 路由到 aiter-flash-attn、DETR 图像处理加速、重映射 indexers 的 layer_type、修复 vLLM 后端视频输入 token 计数、DINO 系列模型现代化改造以及 Kernels 版本升级

待验证50%
9月26日

Ollama的KV Cache支持三档量化:F16、Q8_0、Q4_0,硬件抽象层覆盖CUDA、ROCm、Vulkan、Metal四条线

待验证50%
9月25日

首次生成慢、后续快的现象源于GPU计算图编译与缓存机制,第一次运行需将计算图编译为适配硬件的底层指令,结果缓存后后续可复用

待验证50%
9月22日

WSL2的DXG桥接允许Windows Subsystem for Linux通过DirectX驱动访问宿主机GPU,绕过传统ROCm依赖/dev/kfd字符设备的路径

待验证50%
9月22日

新版本新增了包含Unsloth Studio和JupyterLab的AMD ROCm Docker镜像,且ROCm镜像可通过WSL2的DXG桥接访问GPU

待验证70%
9月22日

当 ROCm 版本无法运行时,系统会回退到 Vulkan 的 sd.cpp 构建

待验证70%
9月22日

新增了带有 Unsloth Studio 和 JupyterLab 的 AMD ROCm Docker 镜像

待验证70%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

ROCm是AMD面向高性能计算和AI工作负载的开源软件平台,包含HIP编程接口,允许CUDA代码以较低成本移植到AMD GPU

90%
已验证

AMD的ROCm和Intel的oneAPI在生态完整度、社区支持和性能调优工具方面与CUDA仍存在显著差距

75%
已验证

llama.cpp支持NVIDIA GPU通过CUDA、AMD GPU通过ROCm、Apple Silicon通过Metal GPU加速,也支持纯CPU推理

70%
已验证

ROCm是AMD于2016年推出的开源GPU计算平台,当前ROCm 6.x版本已对PyTorch、TensorFlow提供官方支持

65%
已验证

AMD的ROCm平台自2016年启动,提供HIP作为CUDA的兼容层,PyTorch官方已提供ROCm预编译包

65%
已验证

ROCm的核心组件HIP提供与CUDA高度相似的API,使CUDA代码可通过hipify工具转换后在AMD GPU上运行,ROCm版PyTorch复用torch.cuda命名空间

65%
待验证

AMD显卡可通过ROCm或DirectML方案运行Stable Diffusion,但兼容性和性能不如NVIDIA

85%
待验证

新版本新增了包含Unsloth Studio和JupyterLab的AMD ROCm Docker镜像,且ROCm镜像可通过WSL2的DXG桥接访问GPU

70%
待验证

当 ROCm 版本无法运行时,系统会回退到 Vulkan 的 sd.cpp 构建

70%
待验证

vLLM支持AMD ROCm平台,并在持续完善该支持

70%
待验证

ROCm(Radeon Open Compute)是AMD对抗NVIDIA CUDA生态的核心开源GPU计算平台

70%
待验证

HIP是AMD推出的对标CUDA的方案,语法与CUDA高度相似,旨在实现GPU代码的跨平台可移植性

70%
待验证

AMD 安装会在 Windows 与 Linux 上自动选择最佳构建版本,并在更多 GPU 上启用 BF16

70%
待验证

Simultaneous support for Metal, CUDA, and ROCm is uncommon among open-source inference projects

70%
待验证

SGLang 的开源属性使其能够比 NVIDIA 主导的 TensorRT-LLM 更快速地集成 AMD ROCm 生态的新特性

70%
待验证

ds4 is written in pure C with native support for Metal, CUDA, and ROCm backends

60%
待验证

RCCL(ROCm Collective Communications Library)是AMD为ROCm平台开发的集合通信库,功能上对标NVIDIA的NCCL

50%
待验证

PyTorch的torch.compile、OpenAI的Triton编译器以及AMD的ROCm平台共同构建了硬件无关的更高抽象层

50%
待验证

5.18.0 引入了六项破坏性改动,包括 ROCm 平台 gpt-oss 将 FA3 路由到 aiter-flash-attn、DETR 图像处理加速、重映射 indexers 的 layer_type、修复 vLLM 后端视频输入 token 计数、DINO 系列模型现代化改造以及 Kernels 版本升级

50%
待验证

Ollama的KV Cache支持三档量化:F16、Q8_0、Q4_0,硬件抽象层覆盖CUDA、ROCm、Vulkan、Metal四条线

50%

来源文章