FP8训练登陆AMD GPU:TorchTitan性能优化上游合并

AMD将FP8训练优化上游合并至PyTorch官方项目,实现千卡线性扩展,推动AMD GPU进入AI训练主流生态。
AMD在PyTorch Conference 2025上宣布,通过Primus-Turbo优化库,在TorchTitan和TorchAO两个PyTorch核心项目中实现了AMD Instinct GPU的FP8训练支持,并已正式上游合并至官方仓库。这意味着用户无需额外配置即可在AMD GPU上获得具竞争力的FP8训练性能。技术层面,AMD还展示了超过1000块GPU规模下的线性扩展能力,证明其硬件互联与软件优化均已具备大规模训练的成熟度。此举被业界视为AMD打破CUDA生态垄断、构建AI训练软件护城河的重要一步,也为寻求算力多元化的企业和研究机构提供了实质性的替代选项。
AMD GPU迈入FP8训练主流生态
在深度学习训练领域,NVIDIA的CUDA生态长期占据主导地位,而AMD Instinct系列GPU虽然在硬件性能上不断突破,却始终面临软件生态适配的挑战。近日,AMD在PyTorch Conference 2025上公布的一项成果,为改变这一格局迈出了关键一步。
据AMD官方博客介绍,团队展示了在AMD Instinct集群上实现超过1000块GPU的线性扩展能力,其背后的核心是Primus-Turbo——AMD为TorchTitan等训练框架打造的优化库。更重要的是,AMD已将这些优化正式**上游合并(upstream)**到了PyTorch官方仓库,使TorchTitan能够直接支持AMD Instinct GPU,并且开箱即用地提供具有竞争力的FP8训练性能。

为什么FP8训练如此重要
精度与效率的平衡
FP8(8位浮点数)是近年来大模型训练中备受关注的低精度数值格式。相比传统的FP16或BF16,FP8在保持可接受训练精度的前提下,能够显著降低显存占用、提升计算吞吐量并减少通信开销。这对于动辄千亿参数的大语言模型训练而言,意味着更低的成本和更快的迭代速度。
然而,FP8训练对硬件和软件栈都提出了较高要求。此前,成熟的FP8训练支持主要集中在NVIDIA的Hopper架构GPU上,AMD用户往往难以享受到同等的效率红利。此次AMD将FP8优化整合进TorchAO和TorchTitan,正是补齐这块短板的关键动作。
千卡线性扩展的意义
线性扩展(linear scaling)是分布式训练系统的重要指标。理想情况下,GPU数量翻倍,训练吞吐量也应接近翻倍。而在实际系统中,随着规模增大,通信瓶颈、同步开销等因素往往导致扩展效率下降。AMD此次在超过1000块GPU规模上实现线性扩展,证明了其硬件互联能力与软件优化的成熟度,也为大规模训练任务提供了可靠的替代方案。
上游合并的战略价值
从私有优化到开源标准
AMD此次强调,所有相关贡献都已经合并到上游的pytorch/AO和pytorch/TorchTitan仓库。这一点尤为关键。过去,硬件厂商的优化往往以独立分支或私有库的形式存在,用户需要额外配置、维护成本高,且难以享受主线更新。
将优化直接上游到PyTorch官方项目,意味着:
- 开箱即用:用户无需寻找第三方补丁,安装标准PyTorch即可获得AMD FP8训练能力
- 持续维护:代码进入主线后,将随PyTorch版本迭代持续更新和维护
- 生态认可:这也从侧面反映出PyTorch社区对AMD硬件支持的重视程度提升
TorchTitan与TorchAO的角色
TorchTitan是PyTorch官方推出的大规模训练参考实现,专注于展示如何用原生PyTorch特性高效训练大模型。TorchAO则是PyTorch的架构优化库,负责量化、低精度等性能优化功能。AMD选择在这两个核心项目上贡献代码,等于是在PyTorch训练生态的关键节点上确立了自身的存在感。
对行业格局的潜在影响
打破单一供应商依赖
长期以来,AI训练算力高度依赖单一供应商,这不仅带来采购成本压力,也在供应链安全上埋下隐患。AMD Instinct GPU若能在主流训练框架上提供与竞品相当的性能和易用性,将为企业和研究机构提供实质性的多元化选择。
软件生态才是真正的护城河
这一事件再次印证了一个业界共识:在AI硬件竞争中,芯片的峰值算力固然重要,但真正决定采用率的往往是软件生态的完善度。AMD通过Primus-Turbo优化库切入,再通过上游合并融入PyTorch主线,走的正是一条务实的生态建设路线。
结语
AMD将FP8训练优化上游到TorchTitan和TorchAO,是其在AI训练领域生态建设上的一次重要落子。千卡线性扩展的性能展示与开箱即用的FP8支持,让AMD Instinct GPU在大模型训练场景中的竞争力显著提升。对于寻求算力多元化的团队而言,这无疑是一个值得关注的信号。随着更多优化持续进入PyTorch主线,AMD在训练生态中的地位或将进一步稳固。
相关推荐

AI主导测试实战:用Vibe Coding搭建测试工作台全攻略
详解AI主导测试与AI辅助测试的本质区别,手把手搭建AI测试工作台:从Claude Code+DeepSeek组合配置,到Node环境安装、npm镜像加速,帮助测试工程师完成从执行者到统筹者的能力升级。

MCP拦截器:实时守护AI Agent安全的最后防线
深入解析实时MCP拦截器如何在AI Agent与系统之间建立安全屏障,拦截敏感文件读取和危险命令执行,防御提示词注入攻击,保障Agent生产环境的安全运行。

Harbor:统一80+基准的AI Agent评估框架详解
深入解析Harbor Adapters和Harbor-Index如何通过统一适配器层整合80+基准测试,开展8模型×54基准的大规模AI Agent评估实验,并构建82个高质量任务的元数据集,推动Agent评估标准化。