[控场AI]
· 5 分钟阅读· 2,612 字

前英特尔CEO炮轰HBM:高带宽闪存或将取而代之

前英特尔CEO炮轰HBM:高带宽闪存或将取而代之

HBM正遭前英特尔CEO及供应商SK海力士高管质疑,堆叠越高带宽越稀释,高带宽闪存被视为潜在替代路线。

本文梳理了近期AI内存领域一场罕见的公开质疑:前英特尔CEO直言"HBM很糟糕",分析机构Irrational Analysis称其为"一个错误",连主要供应商SK海力士高管也承认HBM并非内存墙的最终答案。批评的核心在于HBM的演进逻辑——通过垂直堆叠更多DRAM层来提升容量——会导致每层可分配的有效带宽被持续稀释,极端情况下单层性能甚至不及普通商用内存。讨论中出现了"高带宽闪存"这一替代方向,利用NAND闪存的高容量密度结合高带宽封装接口,可能在大模型推理等容量敏感场景提供更高性价比。不过HBM目前仍是AI加速卡的事实标准,替代方案有待实测产品验证,此次争论更多是对长期技术路线的预警,而非对现状的即时否定。

HBM遭遇行业质疑

在AI芯片对内存带宽近乎贪婪的需求下,高带宽内存(HBM)一度被视为破解"内存墙"的关键技术。然而,来自行业内部的一系列质疑声正在改变这一叙事。前英特尔CEO在近期的公开讨论中直言"HBM很糟糕(HBM is lousy)",业内分析机构Irrational Analysis更是抛出"HBM is a mistake"的尖锐评价。

耐人寻味的是,这种质疑并非只来自竞争对手或外部观察者。作为HBM主要供应商之一的SK海力士,其一位副总裁也承认:"HBM并不是解决内存墙问题的最终答案。"当上游供应商都开始为自己的核心产品留出讨论空间时,意味着这场关于内存架构路线的争论已经进入深水区。

reddit source: Former Intel CEO: HBM is lousy

HBM(High Bandwidth Memory,高带宽内存)的核心设计思路是将多颗DRAM芯片通过TSV(硅穿孔,Through-Silicon Via)技术垂直堆叠,再以2.5D封装方式与GPU/AI加速芯片并排集成在同一个基板(Interposer)上。这种方式使内存与计算单元之间的物理距离极短、连接引脚数量极大,从而实现了远超传统GDDR内存的带宽——HBM3e的峰值带宽可达每秒1.2TB以上,而GDDR6X约为1TB。英伟达H100等主流AI训练卡均采用HBM作为主存,其高带宽特性对矩阵乘法等访存密集型算子至关重要。正是因为HBM深度嵌入当前AI基础设施,任何对其路线的质疑都牵动着从芯片设计到数据中心采购的整条产业链。

"往高处堆"的技术悖论

争论的核心在于HBM的技术演进方向:通过垂直堆叠更多的DRAM芯片来提升容量与带宽。但堆得越高,问题也越明显。

批评者指出的一个关键矛盾是:"如果堆叠层数足够高……每一个核心die的运行速度反而比普通的商用内存还要慢。"这背后的逻辑是,当带宽被分摊到越来越多的堆叠层上时,单层所能获得的有效吞吐量被大幅稀释。

在Hot Chips 2026的问答环节中,Irrational Analysis提出了一个极具穿透力的质问:"你们谈到HBM4要堆到20层厚,也许每平方厘米能达到4TB的容量。但这意味着20层堆叠中,每一层只分到单芯片带宽的20%左右。你们把吞吐量稀释得非常严重。为什么这是正确的方向?为什么你们如此专注于把内存堆得更高,而不是让它跑得更快?"

这个问题直指HBM演进路线的软肋——行业在容量竞赛中,可能牺牲了每单位存储的性能效率。

理解"带宽被稀释"这一批评,需要了解HBM的物理结构限制。TSV技术在芯片垂直方向打孔并填充导电材料,使上下层芯片互联,但TSV的密度和信号完整性存在工程上限。当堆叠层数从HBM2的8层增加到HBM4规划中的16—20层时,底层的逻辑基底Die(Base Die)需要同时驱动所有DRAM层的I/O,而总的对外接口带宽并未等比例增加。换言之,对外带宽由封装引脚数决定,与堆叠层数无关;但容量随层数线性增长,导致"带宽/容量"比值持续下降。对于AI推理场景,如果模型权重读取速度受限于这一稀释后的单层带宽,增加层数带来的容量收益可能无法抵消效率损失,这正是批评者所指的"性价比陷阱"。

高带宽闪存:下一个替代方案?

讨论中反复出现的概念是"高带宽闪存(High Bandwidth Flash)"。这一术语暗示,业界正在探索用闪存(NAND)类介质结合高带宽接口的思路,来重新定义AI计算的内存层级。

从技术演进角度看,闪存在容量密度和成本上相较DRAM有天然优势。如果能够解决带宽与延迟的瓶颈,将其接入类似HBM的封装形态,理论上可以在超大模型推理这类对容量极度敏感的场景中提供更具性价比的方案。当然,闪存的写入寿命、延迟特性与DRAM有本质差异,能否真正胜任AI训练/推理的负载,仍需实际产品验证。

值得强调的是,目前这些讨论仍停留在架构辩论和路线预判层面,尚无成熟量产产品可供对比。

NAND闪存与DRAM在物理机制上存在本质差异:DRAM通过电容充放电存储数据,读写延迟约为60—100纳秒;而NAND闪存通过浮栅或电荷陷阱存储电荷,读取延迟通常在10—100微秒量级,写入还涉及块擦除操作,延迟更高且存在写入次数限制(TBW)。因此,"高带宽闪存"若要进入AI加速卡的主存位置,必须在接口协议和控制器层面做大量创新,以掩盖闪存固有的高延迟,同时通过高度并行化(大量芯片同时读取)来堆砌聚合带宽。目前业界的探索方向包括CXL(Compute Express Link)扩展内存和存算一体架构,但尚无成熟方案能在AI训练的随机访存模式下与HBM正面竞争。推理场景(尤其是大模型的权重加载)因访存模式更规律,被认为是闪存类方案最可能率先突破的切入点。

争论背后的产业信号

这场围绕HBM的批评,透露出几个值得关注的产业动向。

其一,AI算力扩张让内存成本成为整机成本中越来越大的比重,HBM的高溢价正在受到审视。批评者预言:"很快我们都会回头感慨,为什么人们要为如此低效的东西付出这么高的价格。"这反映出市场对当前HBM定价与实际效率之间落差的不满。

其二,供应商内部的分歧表明,内存架构远未定型。SK海力士高管的表态说明,即便是既得利益方,也在为技术转向预留空间,而非把宝全押在HBM的堆叠路线上。

其三,Hot Chips这类顶级芯片会议成为路线争论的公开战场,说明这一议题已从工程细节上升为战略选择。

不过需要理性看待:HBM在当前AI加速卡中仍是事实标准,短期内难以被替代。这些批评更多是对长期技术方向的警示,而非对现状的即时否定。高带宽闪存能否兑现承诺,最终仍取决于实测数据与规模化落地。

写在最后

从"内存墙"的破解者到被质疑"低效",HBM在短短几年内经历了口碑的微妙变化。这场由前英特尔CEO、分析机构乃至供应商共同参与的辩论,本质上是在追问:面对AI时代的内存需求,堆叠更高真的是唯一正确的路径吗?答案或许要等到高带宽闪存等替代方案拿出真实产品的那一刻才会揭晓。在此之前,保持一份对技术叙事的审慎,对每一位关注AI硬件的人都是必要的。

分享:

相关推荐