AMD MI355X运行GLM5.2:推理成本仅为英伟达Blackwell的一半

AMD MI355X挑战英伟达:性价比成AI算力新战场
近日,AMD最新数据中心GPU MI355X运行GLM5.2大模型的性能数据引发业界广泛关注。据报道,MI355X在运行GLM5.2时实现了单节点2626 tokens/秒的推理吞吐量,而其运行成本仅为英伟达Blackwell架构的一半以下。
这一数据的公布,恰逢AI推理成本成为整个行业焦点的关键时刻。随着大模型从训练走向大规模部署,推理阶段的经济性正日益成为决定企业AI战略的核心变量。
数据背后的含义
单看2626 tok/s/node这个数字,需要结合具体语境理解。在大模型推理中,吞吐量(tokens per second)直接决定了单位时间内能服务多少用户请求。对于面向消费者或企业的AI服务而言,更高的吞吐量意味着在相同硬件投入下能承载更大的并发量。
而真正引人注目的是成本对比——「2x lower cost than Blackwell」意味着在达到相近或可比性能的前提下,AMD方案的总拥有成本(TCO)只有英伟达旗舰方案的约一半。这里需要理解「Blackwell」所代表的竞争基准:英伟达Blackwell架构(以数学家David Harold Blackwell命名)是2024年发布的新一代数据中心GPU架构,旗舰产品包括GB200 NVL72等超级芯片系统。Blackwell的核心创新包括第二代Transformer引擎、NVLink Switch系统以及FP4精度支持,在AI训练和推理性能上均较上代Hopper(H100)实现大幅跃升。然而,Blackwell系列产品的高昂售价与持续供货紧张,使得其实际TCO对众多企业而言压力显著。正是在这一背景下,AMD以「成本减半」为切入点的竞争叙事,才具备了现实的市场说服力。
TCO在AI基础设施采购中涵盖硬件购置成本、能耗电费、冷却成本、运维成本及软件许可等多个维度。对于大规模推理集群,能耗往往占TCO的30%-50%。AMD MI355X若能在相近推理性能下降低功耗或提升能效比(Performance per Watt),即便硬件售价相近,长期运营成本也可能产生显著差异,这正是「2x lower cost」论述的潜在逻辑基础。这对于长期被英伟达生态锁定的AI基础设施市场,无疑是一个有力的信号。
值得关注的是,MI355X作为Instinct系列的最新成员,在硬件规格层面针对推理场景进行了深度优化。其搭载的HBM3e内存不仅在峰值带宽上超越上代产品,更在每瓦性能(Performance per Watt)方面实现显著提升。对于7×24小时持续运行的推理集群而言,这种能效改善将随着运营时长的累积,在电费账单上体现出可观的长期节省效应——而这正是TCO计算中往往被硬件采购阶段所低估的隐性成本。
供应链经济学视角:从宏观经济角度审视,AI算力供应商集中度风险已引发主要科技公司的战略警惕。英伟达H100/H200在2023-2024年的严重供货短缺,导致部分云厂商的GPU租用价格一度攀升至每小时8-10美元,直接推高了AI服务的边际成本。在这一背景下,AMD提供具备竞争力的替代方案,不仅是技术层面的竞争,更是整个AI产业链降低系统性供应风险的结构性需求——主要云服务商(AWS、微软Azure、谷歌Cloud)维持多元化算力供应商策略,本质上是将算力采购纳入供应链韧性管理框架的理性选择。
为什么推理成本如此关键?
从训练到推理的重心转移
过去几年,AI硬件竞争的焦点集中在训练能力上。谁能更快训练出更大的模型,谁就掌握了话语权。但随着GPT、Claude、GLM等大模型进入实际应用阶段,行业重心正向推理侧加速倾斜。
推理有一个训练所不具备的特点:它是持续、高频、大规模的。一个模型训练完成后可能只需执行一次,但推理请求却会日以继夜地涌来。因此,即便是每token成本上的微小差异,在数十亿次调用的规模下也会被急剧放大,直接影响企业的AI运营利润。
根据行业分析机构的市场预测,到2027年前后,全球AI推理市场的规模将超越AI训练市场,成为算力需求的主要驱动力。这一结构性转变的背后逻辑在于:训练行为的频次相对有限,且单次训练所需的算力可通过任务调度在时间维度分散;而推理请求则与用户活跃度强相关,在消费级AI产品大规模普及的背景下,推理算力需求呈现出近乎线性增长的特征。正是这一趋势,使得以推理性价比为核心卖点的竞争策略具备了长期的战略价值,也是AMD此时集中资源突破推理场景的深层市场逻辑。
AI推理市场竞争格局的现状与演变:根据行业分析机构的数据,英伟达在AI训练GPU市场的份额长期维持在80%以上,在推理市场的份额亦超过70%。然而,推理市场的竞争格局正在经历比训练市场更快速的分化:谷歌TPU、亚马逊Trainium/Inferentia、英特尔Gaudi系列均在积极布局,AMD Instinct系列则是其中综合竞争力最接近英伟达的通用替代方案。值得注意的是,市场份额的转移在数据中心基础设施领域通常呈现出明显的滞后效应——采购周期长、生态迁移成本高、工程团队技能惯性等因素共同决定了这场竞争的节奏将以年为单位演进,而非季度级别。这也意味着AMD在推理性价比上的技术突破,需要持续至少数个产品周期才能真正反映为可见的市场份额变化。
GLM5.2作为测试标的的代表性
GLM(General Language Model)系列由清华大学与智谱AI联合研发,其架构核心是对标准Transformer的自回归空白填充预训练目标的深度改造,通过双向注意力与单向注意力的混合机制在长文本理解与生成任务上取得差异化优势。GLM5.2作为系列新版本,参数规模与上下文窗口均有显著提升,在开源社区和商业部署中均有相当影响力。以这类主流开源大模型进行跨硬件平台的性能对比,比使用私有闭源模型更具参考价值,结果也更易被社区独立复现和验证——其开源策略使得社区可对测试结果进行独立复现,提升了跨平台性能对比的可信度。
值得一提的是,此次测试很可能依托vLLM等主流推理框架完成。vLLM是加州大学伯克利分校开源的高性能大模型推理框架,其核心创新在于PagedAttention技术——借鉴操作系统虚拟内存分页管理的思想,将KV Cache(键值缓存)切分为非连续的内存块动态管理,大幅提升显存利用率和推理吞吐量。
理解KV Cache为何如此重要,需要深入Transformer的推理机制:在自回归生成中,每生成一个新token,模型都需要访问此前所有token对应的Key和Value向量。为避免重复计算,这些向量被缓存在显存中。随着上下文长度增加,KV Cache占用的显存空间呈线性增长——对于百亿参数级别的模型,长上下文场景下KV Cache可能占据数十GB显存。以128K token窗口的长上下文任务为例,单个推理请求的KV Cache可能超过20GB,直接压缩批处理并发数(Batch Size),使得显存容量与带宽成为推理吞吐量的真实瓶颈,而非计算单元利用率。这直接导致推理场景对显存容量和带宽的需求远超训练场景的直觉预期,也解释了为何MI355X的大容量HBM3e配置在推理场景中能发挥出超越算力层面的竞争优势。
vLLM对ROCm的支持已从早期的实验性适配演进为生产级支持,这一进展背后是AMD与伯克利研究团队之间持续的深度合作。这种软硬件协同优化模式是AMD近年来生态战略转型的缩影:不再单纯依赖硬件参数层面的竞争,而是主动参与上层软件栈的共建与维护,通过降低开发者的迁移摩擦来扩大可寻址市场。vLLM已成为工业级LLM部署的主流选择之一,其对ROCm的支持程度也直接反映AMD软件生态的成熟度。
AMD MI355X的技术优势解析
CDNA架构与HBM显存的协同优势
MI355X属于AMD Instinct系列数据中心加速卡,基于CDNA架构演进而来。CDNA(Compute DNA)架构是AMD专门为数据中心计算工作负载设计的独立架构路线,与面向消费级显卡的RDNA架构彻底分离。自2020年首代推出以来,CDNA持续迭代:CDNA1(MI100)、CDNA2(MI200系列)、CDNA3(MI300系列),MI355X代表这一路线图的新一代演进。
CDNA架构的深度创新:CDNA3是AMD架构演进中的重要转折点,首次引入统一内存架构(Unified Memory Architecture),将CPU与GPU的内存地址空间整合为统一寻址空间,大幅降低异构计算中的数据搬运开销——这在大模型推理的预填充(Prefill)阶段尤为关键。此外,CDNA3大幅扩展了矩阵加速单元(Matrix Core)的FP8计算密度,MI355X在此基础上进一步强化了对INT4/FP4等超低精度格式的原生支持。量化推理(Quantized Inference)是在不显著损失模型精度的前提下压缩权重位宽、降低显存占用与计算量的核心技术——从FP16降至FP8可将显存需求减半,从FP8降至FP4则可进一步减半,这对在有限显存内服务更长上下文或更大批次具有直接意义,也是MI355X推理成本优势的重要技术来源之一。
MI300X曾凭借192GB HBM3显存容量在大模型推理场景引发广泛关注,而MI355X在此基础上进一步提升了HBM3e内存带宽与计算单元密度,彰显了AMD将数据中心AI加速器视为战略核心业务的坚定投入。
对于大模型推理这类内存带宽敏感的工作负载,显存容量和带宽往往比纯算力更为关键。这背后有一个深层的物理机制:大模型推理的性能瓶颈本质上是一个「计算访存比」(Arithmetic Intensity)失衡问题。以一个700亿参数的模型为例,每次前向推理需从显存加载约140GB权重数据(FP16精度),而实际执行的浮点运算量相对有限——这意味着硬件大部分时间在等待数据从显存搬运至计算单元,而非执行运算。这种特性使得推理场景天然是「访存密集型」而非「计算密集型」,高带宽内存(HBM,High Bandwidth Memory)的超高带宽因此成为决定推理吞吐量的第一性因素。
HBM采用3D堆叠技术将多层DRAM芯片垂直叠加,并通过硅通孔(TSV,Through-Silicon Via)连接,实现极高的内存带宽。具体而言,传统GDDR6X内存的带宽约为1TB/s量级,而HBM3e则可将这一数字推进至接近5TB/s,带宽差距超过4倍。MI355X配备的HBM3e内存带宽可达数TB/s量级——推理时模型权重需要反复从显存读取,带宽瓶颈往往比算力瓶颈更先到来。AMD在HBM容量与带宽方面的配置策略,恰好切中了推理场景的核心痛点,与vLLM的PagedAttention在架构层面形成协同效应:PagedAttention通过减少显存碎片化来提升有效带宽利用率,而MI355X的高带宽HBM3e则为这种优化提供了更宽裕的物理上限,二者共同作用,使整体推理吞吐量获得乘数级的提升空间。
ROCm软件生态的加速成熟
长期以来,AMD在AI领域最大的短板并非硬件,而是软件生态。英伟达凭借CUDA(Compute Unified Device Architecture)构建了近乎垄断的开发者护城河——这一平台自2006年推出以来,经过近20年积累,已形成覆盖深度学习框架、高性能库、调试工具链的完整闭环。CUDA生态的真正壁垒并非API本身,而是其上层积累的海量优化库:cuDNN(深度神经网络库)、cuBLAS(线性代数库)、NCCL(多GPU通信库)等专用库经过多年针对具体硬件架构的深度调优,性能往往远超通用实现。此外,数以万计的开源项目、学术论文代码、企业内部工具均默认以CUDA为目标平台开发,开发者迁移至其他平台的切换成本极高。
AMD的ROCm(Radeon Open Compute)平台是其对标CUDA的开源替代方案,通过HIP(Heterogeneous-compute Interface for Portability)API实现对CUDA代码的高度兼容,使开发者迁移成本显著降低。然而,HIP转译工具虽能处理大部分语法层面的迁移,性能层面的深度对齐仍需大量工程投入——这是ROCm生态追赶的核心难点所在。
ROCm与CUDA的性能差距现状:以矩阵乘法这一AI计算中最频繁的基础操作为例,英伟达的cuBLAS库在A100/H100上的性能调优已历经超过十年的持续迭代,其针对Tensor Core微架构的专有优化积累了极深的技术壁垒;ROCm对应的rocBLAS近年性能大幅追近,但在FP8、FP4等新精度格式和特殊算子(如Flash Attention变体)上仍存在一定差距。值得关注的是,AMD近年来采取了「开源优先+社区共建」的追赶策略,通过向PyTorch、vLLM等主流框架贡献ROCm后端代码,将优化工作分散至更广泛的开发者社区——这与英伟达封闭自研的路线形成鲜明对比,也在一定程度上加速了ROCm在生产环境中的适用性提升。
近两年,ROCm软件栈快速迭代,对PyTorch、vLLM等主流推理框架的支持日趋完善。此次GLM5.2能够在MI355X上跑出可观的性能数据,本身就是ROCm生态成熟度持续提升的有力佐证。
对AI算力市场格局的影响
打破单一供应商依赖
当前AI算力市场高度依赖英伟达,供应紧张、价格高企是普遍现象。AMD若能持续提供「性能可比、成本减半」的替代方案,将为云服务商和大型AI企业提供宝贵的议价筹码与供应链多元化选择。
即便AMD无法在绝对性能上超越英伟达,只要在性价比这一维度建立起明确优势,便足以在庞大的推理市场中占据一席之地——而推理市场的规模,正随着大模型的普及呈指数级增长。从供应链风险管理的角度审视,主要云服务商(AWS、微软Azure、谷歌Cloud、阿里云广告等)维持多元化算力供应商策略是其长期战略诉求,对英伟达的过度依赖不仅带来价格谈判的劣势,更在供货紧张时期形成实质性的业务扩展瓶颈。AMD提供具备竞争力的替代选择,客观上有助于这些平台实现算力采购的战略再平衡,而这种再平衡一旦形成规模效应,将进一步推动AMD在AI推理硬件市场的份额扩张。
理性看待厂商性能数据
说个细节,此类性能与成本对比数据通常来自特定测试配置,结论可能受到测试方立场、软件版本、批处理大小、精度设置等多重因素影响。「2x lower cost」这样的表述,需要完整的测试方法学支撑才能全面评估。
性能基准测试的方法学陷阱:AI硬件性能对比中,批处理大小(Batch Size)的选取对结果影响尤为显著——小批次(Batch Size=1)场景侧重测试延迟(Latency),大批次场景侧重测试吞吐量(Throughput),两种场景下不同硬件的相对优势可能完全不同。此外,量化精度(FP16、BF16、INT8、FP8)的选择、KV Cache压缩策略、张量并行度配置均会显著影响最终数字。因此,「单节点2626 tokens/秒」这一数据,需结合具体批处理规模、序列长度、量化方案等参数才具备完整的参考价值;「成本减半」的结论则更需要明确TCO计算周期(1年/3年/5年)、电价假设和硬件折旧方式等边界条件。
在实际采购决策中,企业仍应结合自身工作负载进行独立验证。此外,该消息目前缺乏充分的第三方复现和交叉验证,因此更应作为一个值得持续跟踪的趋势信号,而非可直接援引的定论。
总结:性价比竞争时代正式开启
MI355X运行GLM5.2的这组数据,折射出AI硬件竞争正从「唯性能论」走向「性能与成本并重」的新阶段。从CDNA架构引入统一内存与FP4原生支持的持续演进、HBM3e对推理内存带宽瓶颈的精准切中,到ROCm生态对主流框架支持的日趋完善,AMD正在硬件架构、内存子系统与软件栈三个维度同步补强其竞争力。对整个行业而言,一个更具竞争性的算力市场,最终将惠及所有AI应用的开发者与使用者。AMD能否凭借推理成本优势真正撼动英伟达的市场地位,仍需更多实际部署案例的检验——但这条追赶之路,显然已走得越来越有底气。
核心要点
- 推理成本已成新战场:AI行业重心从训练转向推理,每token成本的微小差异在海量调用下将被急剧放大
- MI355X的核心竞争力:HBM3e高带宽内存(近5TB/s,是GDDR6X的4倍以上)精准切中推理内存瓶颈,CDNA3统一内存架构与FP4原生支持进一步强化量化推理优势,与vLLM等主流框架形成软硬件协同效应
- ROCm生态持续成熟:从实验性支持到生产级部署的跨越,是AMD此次性能数据可信度的重要背书;「开源优先+社区共建」策略正在加速缩短与CUDA生态的差距
- 市场结构性机遇:到2027年推理市场规模预计超越训练市场,供应链多元化需求客观上为AMD创造了战略性市场入口;但市场份额转移在数据中心领域存在明显滞后效应,竞争节奏将以年为单位演进
- 理性评估数据:厂商公布的性能数据需结合批处理大小、精度设置、TCO计算边界等方法学参数审慎解读,独立验证仍是采购决策的必要前提
相关推荐

顶尖企业用好AI的秘诀:从实验走向成熟管理层
基于KPMG第三季度AI Pulse调查,解析用好AI的顶尖企业与实验阶段企业的关键差距:模型路由、数据主权、AI管理层、成本与价值管理,以及从效率到机会的用途转变。

付费用户因"网络滥用"遭ChatGPT封号:1分钟秒拒的申诉机制引众怒
一名付费ChatGPT用户因"网络滥用"被无预警封号,三次申诉均在一分钟内被机器人驳回,全程无人工审核。本文梳理事件经过、可能的误判原因,并剖析AI平台自动化治理的申诉困境与开发者应对建议。

OpenSOP:用Git管理多语音Agent提示词的开源方案
OpenSOP 是一个开源工具,用 Git、YAML 和 Markdown 管理多个AI语音Agent的提示词,解决提示词重复、漂移和手动同步难题,支持改动影响预览和一键回滚。