DeepSeek-V4 Flash RL训练成功迁移AMD MI355X GPU全解析

背景:RL训练走向多元硬件生态
长期以来,大模型的强化学习(RL)训练几乎被英伟达GPU生态所垄断。随着AMD Instinct系列加速卡与ROCm软件栈的持续成熟,这一格局正在悄然改变。近日,Miles团队联合AMD官方宣布,成功将DeepSeek-V4 Flash的RL训练完整迁移到AMD Instinct MI355X GPU上,并实现了端到端的稳定运行。
ROCm(Radeon Open Compute)是AMD推出的开源GPU计算平台,通过HIP(Heterogeneous-compute Interface for Portability)编程模型为开发者提供类似CUDA的体验,允许将CUDA代码相对低摩擦地迁移到AMD硬件。值得注意的是,ROCm平台自2016年首次发布以来,始终面临与CUDA生态的巨大差距——CUDA经过近20年积累,拥有庞大的优化库(cuDNN、cuBLAS、NCCL等)、成熟的调试工具链和百万级开发者社区。ROCm通过HIP层实现的CUDA兼容,在实践中长期面临算子性能差异、通信库稳定性不足、第三方库适配滞后等挑战。ROCm 6.x版本在2024年引入了对FP8的硬件级支持、改进的RCCL(ROCm Collective Communications Library)通信性能,以及更完善的MoE模型算子优化,这些改进是本次迁移得以成功的关键软件基础,也使得ROCm在生态完整性与稳定性方面取得了显著进步。
这一进展的意义不仅在于「跑通」,更在于团队通过系统性工程验证,证明了在ROCm平台上进行大规模RL训练的可行性与稳定性。对于希望摆脱单一硬件依赖、构建多元算力供应链的企业和研究机构而言,这是一个值得关注的重要信号。
核心成果:从对齐验证到模型收敛
此次迁移工作的核心挑战,在于确保模型在 SGLang rollout(推理采样) 与 Megatron training(分布式训练) 两个引擎间的行为一致性。团队在四个MI355X节点上完成了超过100步优化器迭代的验证,取得了多项关键成果。
训练与采样的数值对齐精度
在RL训练中,PPO(Proximal Policy Optimization)等主流算法依赖rollout阶段采集的log概率来计算重要性采样比率(importance sampling ratio)。理解这一机制的数学本质有助于把握对齐工作的重要性:PPO的核心是通过重要性采样复用rollout数据,其比率 r(θ) = π_θ(a|s) / π_θ_old(a|s) 即当前策略与采样策略的概率比值。当rollout引擎与training引擎对同一token序列计算的log-prob存在系统性偏差时,这个比率会失真——偏差过大将导致PPO的clip机制失效,或引入虚假的策略更新信号,严重时会使训练发散。
Miles团队通过精细的工程对齐,将 train-rollout的log-prob差距在100多步中稳定控制在约0.09的范围内。从数学角度看,0.09的平均偏差意味着两套引擎的数值计算误差不超过约9%,处于基于采样的策略梯度估计的统计噪声可接受范围,不会对梯度估计造成实质性扭曲,为后续稳定训练奠定了坚实基础。
可量化的模型能力提升
更值得关注的是,训练带来了可量化的推理能力增长。在数学推理基准AIME-2024上:
- pass@1 从 0.39 提升至 0.49
- pass@8 从 0.53 提升至 0.67
这意味着DeepSeek-V4 Flash的RL训练不只是在AMD硬件上「能跑」,而是切实实现了模型推理能力的有效提升,验证了整个训练流程的实际有效性。
关键技术:混合精度与分布式并行策略
数据类型感知的在线权重更新
此次工作采用了 FP8 rollout搭配BF16 actor 的混合精度方案。FP8是NVIDIA在H100架构中首次引入硬件支持的8位浮点格式,分为E4M3(4位指数+3位尾数,适合前向传播)和E5M2(5位指数+2位尾数,适合梯度计算)两种子类型,AMD MI355X同样在硬件层面原生支持FP8计算,这是其相比上一代MI300X的重要能力升级。相比BF16(Brain Float 16),FP8在相同内存带宽下可处理约2倍数据量,矩阵乘法吞吐理论上可翻倍,因此推理采样阶段使用FP8以获得更高的吞吐效率。
然而FP8的动态范围极窄(E4M3仅能表示约±448的数值),需要配合精细的缩放因子(scaling factor)管理和溢出检测机制,在反向传播和梯度累积时容易出现数值溢出或下溢,因此训练侧的actor模型保持BF16精度——BF16兼顾了足够的动态范围与计算效率,是当前大模型训练的主流精度选择。为协调两种不同精度间的权重同步,团队实现了「数据类型感知的在线权重更新」(datatype-aware online weight updates)机制,在计算效率与数值精度之间取得了最优平衡。
ROCm平台上的稳定并行布局
在分布式训练层面,团队在ROCm平台上成功跑通了 TP1 / PP4 / EP4 的并行布局。这三个维度各有分工,也体现了在ROCm平台上的工程取舍:
张量并行(TP)将单个算子的计算矩阵切分到多张GPU,通信频繁且延迟敏感,通常限于同一节点内NVLink互联的GPU之间;TP1表示不启用张量并行,这一选择可能正是为了降低ROCm上高频通信链路的调试复杂度,优先保证稳定性。流水线并行(PP)将模型不同层分配到不同节点,通信量小但引入流水线气泡开销,PP4意味着模型被切分为4个流水线阶段。专家并行(EP)是MoE模型特有的并行维度,需要配合All-to-All通信路由token,EP4表示专家分布在4个并行单元上。TP1/PP4/EP4的组合选择,反映了在ROCm平台上优先保证通信稳定性的工程取舍。
值得特别强调的是,全程未出现集合通信卡顿(collective stalls)。AllReduce、AllGather等跨节点同步通信操作引发的卡顿,历来是非英伟达平台的训练顽疾,这一成果表明ROCm的通信库(RCCL)在实际大规模训练场景中已具备生产可用性。
架构对齐:复杂模型组件的一致性保障
DeepSeek-V4 Flash采用了多项前沿架构设计,包括 混合注意力(Hybrid Attention)、mHC混合机制 以及 哈希路由的MoE(hash-routed MoE)。混合注意力在同一模型中融合标准多头注意力与其他变体(如线性注意力或滑动窗口注意力),以在长序列处理中平衡计算复杂度与表达能力。
哈希路由MoE则是一种特别值得关注的设计:传统MoE使用可学习的门控网络决定token路由,容易产生路由坍塌(Router Collapse)——即大量token被路由到同一少数专家、其他专家被闲置的现象。哈希路由通过对token的位置或内容特征进行哈希运算,确定性地将每个token分配给固定的专家子集,彻底绕过可学习门控,从根本上消除了路由坍塌问题。然而这一确定性设计也带来了严格约束:推理引擎和训练引擎中的哈希函数实现必须逐比特完全一致,任何实现差异都会导致激活不同的专家权重,产生完全无法预测的数值差异,使log-prob对齐工作难度大幅上升。
这些复杂组件在推理引擎与训练引擎中的实现必须严格对齐,任何微小的行为差异都可能在RL训练的长链条中被逐步放大。团队确认,上述所有关键组件在SGLang与Megatron两套引擎间均实现了行为对齐。这也是整个项目最具工程含量的部分——它要求对每一个算子在不同框架、不同硬件后端上的数值行为有深入理解,并进行精细调校。
行业意义:算力生态多元化的标志性节点
从更宏观的视角来看,DeepSeek-V4 Flash在AMD MI355X上的成功落地,是大模型训练算力生态走向多元化的一个标志性事件。
一方面,它降低了对单一硬件供应商的依赖,为算力采购提供了更多战略选择;另一方面,也进一步验证了ROCm软件栈在最前沿RL训练任务中的成熟度。对整个AI基础设施领域而言,硬件层面的良性竞争最终将转化为更低的训练成本与更快的迭代速度。
当然,从「验证100+步」到「支撑完整的生产级RL训练」,中间仍有相当距离。稳定性、长时间运行的收敛表现,以及更大规模集群的扩展性,都是后续需要持续验证的方向。但无论如何,这一步已经打开了新的可能性,AMD MI355X与ROCm生态在大模型强化学习训练赛道上正式进入竞争格局。
相关推荐

Krea 2 图像生成工作流入门:新手如何理清 LoRA 与 Checkpoint
针对 Krea 2 图像生成新手的入门指南,解析如何从免费开源工作流起步,理清 Civitai 上 LoRA 与 Checkpoint 的分工,并掌握写实图像一致性生成的关键技术要点。

Agent评估框架深度解析:自建还是采用现成工具?
深入解析Agent评估框架(eval harness)的四大核心组件——测试用例、执行器、捕获层与评分器,并探讨自建与采用现成框架的决策标准,助力AI工程团队构建可靠的智能体评估体系。

Valve Steam Frame头显:内存涨价打乱定价计划
Valve Steam Frame头显正式发布,但因全球内存和存储市场涨价,定价被迫超出原计划的1059美元。本文解析供应链成本压力如何影响VR硬件定价及行业趋势。