[KongchangAI]
ProductRadeon Open Compute / ROCm平台

ROCm

AMD推出的开源GPU计算平台,是NVIDIA CUDA生态的开源替代方案,支持主流AI框架,面向大模型训练、推理及AI Agent等场景

Core Facts

Timeline (last 90 days)

Oct 5

ROCm在Windows上的生态成熟度远不及Linux,需要专门编写针对GFX1151架构的算子内核才能充分发挥性能

Unverified50%
Oct 5

Strata 的关键突破在于预先编译好了针对 Windows 的 ROCm 内核二进制文件,用户无需自行搭建完整的 ROCm 开发环境

Unverified50%
Oct 5

ROCm 长期以来在 Windows 上几乎没有官方支持,AMD 官方主要维护 Linux 版本

Unverified50%
Oct 5

Strata 会自动下载编译好的 llama.cpp 与 ROCm 内核,用户无需手动安装 HIP 工具链,只要系统装有 AMD 显卡驱动即可运行

Unverified50%
Oct 5

7900XTX 的 Prefill 性能差距更可能源于 ROCm 在 Windows 下的软件层优化尚未成熟,而非硬件本身的问题

Unverified50%
Oct 5

HipBLASLt调优表在表头版本或架构不匹配时会整张拒收,导致稠密投影退回慢路径,Prefill吞吐大幅下降

Unverified50%
Oct 4

RCCL(ROCm Collective Communications Library)是AMD为ROCm平台开发的集合通信库,功能上对标NVIDIA的NCCL

Unverified50%
Oct 4

PyTorch的torch.compile、OpenAI的Triton编译器以及AMD的ROCm平台共同构建了硬件无关的更高抽象层

Unverified50%
Oct 4

RL-Kernel团队将RL-Align/RL-Kernel与vLLM的相关组件集成,在AMD ROCm平台上实现了训练与推理logprob的逐位(bit for bit)匹配

Unverified50%
Oct 4

5.18.0 引入了六项破坏性改动,包括 ROCm 平台 gpt-oss 将 FA3 路由到 aiter-flash-attn、DETR 图像处理加速、重映射 indexers 的 layer_type、修复 vLLM 后端视频输入 token 计数、DINO 系列模型现代化改造以及 Kernels 版本升级

Unverified50%

40 more timeline events

All Facts (20)

Verified

ROCm是AMD面向高性能计算和AI工作负载的开源软件平台,包含HIP编程接口,允许CUDA代码以较低成本移植到AMD GPU

90%
Verified

AMD的ROCm和Intel的oneAPI在生态完整度、社区支持和性能调优工具方面与CUDA仍存在显著差距

75%
Verified

llama.cpp支持NVIDIA GPU通过CUDA、AMD GPU通过ROCm、Apple Silicon通过Metal GPU加速,也支持纯CPU推理

70%
Verified

ROCm是AMD于2016年推出的开源GPU计算平台,当前ROCm 6.x版本已对PyTorch、TensorFlow提供官方支持

65%
Verified

AMD的ROCm平台自2016年启动,提供HIP作为CUDA的兼容层,PyTorch官方已提供ROCm预编译包

65%
Verified

ROCm的核心组件HIP提供与CUDA高度相似的API,使CUDA代码可通过hipify工具转换后在AMD GPU上运行,ROCm版PyTorch复用torch.cuda命名空间

65%
Unverified

AMD显卡可通过ROCm或DirectML方案运行Stable Diffusion,但兼容性和性能不如NVIDIA

85%
Unverified

新版本新增了包含Unsloth Studio和JupyterLab的AMD ROCm Docker镜像,且ROCm镜像可通过WSL2的DXG桥接访问GPU

70%
Unverified

当 ROCm 版本无法运行时,系统会回退到 Vulkan 的 sd.cpp 构建

70%
Unverified

vLLM支持AMD ROCm平台,并在持续完善该支持

70%
Unverified

ROCm(Radeon Open Compute)是AMD对抗NVIDIA CUDA生态的核心开源GPU计算平台

70%
Unverified

HIP是AMD推出的对标CUDA的方案,语法与CUDA高度相似,旨在实现GPU代码的跨平台可移植性

70%
Unverified

AMD 安装会在 Windows 与 Linux 上自动选择最佳构建版本,并在更多 GPU 上启用 BF16

70%
Unverified

Simultaneous support for Metal, CUDA, and ROCm is uncommon among open-source inference projects

70%
Unverified

SGLang 的开源属性使其能够比 NVIDIA 主导的 TensorRT-LLM 更快速地集成 AMD ROCm 生态的新特性

70%
Unverified

ds4 is written in pure C with native support for Metal, CUDA, and ROCm backends

60%
Unverified

ROCm在Windows上的生态成熟度远不及Linux,需要专门编写针对GFX1151架构的算子内核才能充分发挥性能

50%
Unverified

Strata 会自动下载编译好的 llama.cpp 与 ROCm 内核,用户无需手动安装 HIP 工具链,只要系统装有 AMD 显卡驱动即可运行

50%
Unverified

ROCm 长期以来在 Windows 上几乎没有官方支持,AMD 官方主要维护 Linux 版本

50%
Unverified

7900XTX 的 Prefill 性能差距更可能源于 ROCm 在 Windows 下的软件层优化尚未成熟,而非硬件本身的问题

50%

Source Articles