AMD Ryzen AI Halo实测:x86架构能否撼动英伟达DGX Spark?

AMD对标英伟达DGX Spark的迷你AI盒子
在AI本地推理设备赛道上,英伟达DGX Spark一度是话题焦点。如今AMD正式给出了自己的答案——一台搭载Ryzen AI Max Plus 395芯片(即业界熟知的Strix Halo)的迷你盒子,官方命名为Ryzen AI Halo。科技博主Alex Ziskind第一时间拿到实机进行了深度评测,得出的结论颇具启发性:这场较量的胜负手,不在于硅片本身,而在于芯片周围的一切。
Strix Halo芯片:统一内存架构的集大成者
Strix Halo(官方型号Ryzen AI Max Plus 395)是AMD于2025年推出的旗舰APU,代表了AMD在统一内存架构上的重大突破。该芯片采用台积电4nm工艺制造,集成了16个Zen 5 CPU核心与40个RDNA 3.5计算单元GPU,最关键的是支持高达128GB LPDDR5X统一内存池——CPU、GPU与NPU共享同一内存空间,消除了传统离散GPU架构中CPU与GPU之间的数据搬运瓶颈。
理解统一内存架构的价值,需要回溯离散GPU时代的痛点:传统架构中CPU内存与GPU显存物理隔离,数据传输受限于PCIe总线,PCIe 4.0 x16的双向理论带宽约为64GB/s,而片上统一内存的带宽可超过256GB/s——差距超过四倍。对于大语言模型推理而言,权重矩阵需要在每次前向传播时反复读取,内存带宽直接决定了Token生成速度的天花板。这一设计思路与苹果M系列芯片高度相似,但运行在x86生态之上,使其在本地AI推理场景中具备独特竞争力。
说个细节,Strix Halo这颗芯片已被塞进了多款设备——Beelink GTR 9、GMK Tech Evo X2、Framework桌面版、Minisforum、华硕笔记本等。AMD这次只是把这颗现成的芯片装进了一个更小的专用盒子里,售价4000美元。
乍看之下,4000美元买一颗已有的芯片似乎不划算。但Alex发现,整个市场已悄然向4000美元靠拢:Framework 128GB版本、Minisforum、GMK Tech都陆续涨到了这个价位。换句话说,AMD并没有坐地起价,而是站在了行业的普遍水位上。这台Halo也是他手上最小的机器——比Framework小得多,甚至比Spark还小一点,却塞进了128GB统一内存(可供GPU直接调用)。
三类目标用户与真实性能表现
Alex将这台设备的潜在买家分为三类,逐一分析是否值得掏4000美元。
第一类:开发者
对于常规开发工作——写代码、跑技术栈、编译——Halo、Spark和M4 Pro的表现其实非常接近。Alex用Mandelbrot测试(一段吃满所有核心的Python解释型代码)验证:Halo满载功耗164瓦,Spark同为164瓦,Mac约80至90瓦。编译成绩上,Mac 17.3、Spark 15.4、Halo 18.4,差距不大。
结论很直接:如果你只是想编译代码,花4000美元买这台机器毫无必要,有大把更便宜的替代方案。纯开发用途不是Halo的主战场。

第二类:本地AI折腾者(Tinkerers)
这才是Halo真正的目标群体。这台盒子出厂就预装好了全套软件:LM Studio、Ollama(底层跑llama.cpp)、Lemonade、ComfyUI全部就绪。Alex用llama-benchy作为客户端,在三台机器上跑Gemma 4 12B模型进行对比。
在Token生成速度上(受内存带宽限制),Spark和M4 Pro的内存带宽为273GB/s,Halo略低为256GB/s。实测结果:Spark 26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快达33.8 tokens/s。三者相当接近,Halo在日常对话场景完全够用。

预填充速度:Spark的CUDA积累优势
真正拉开差距的是预填充(Prompt Processing)——这是计算密集型环节,由GPU承担。理解这一差距,需要先了解大语言模型推理的两阶段原理:预填充阶段负责处理用户输入的全部提示词并转化为KV Cache(键值缓存),是高度并行的矩阵运算,对GPU计算算力(FLOPS)极为敏感;而解码阶段则逐个生成Token,每步仅读取一次权重矩阵,是典型的内存带宽受限任务。两个阶段的性能瓶颈完全不同,单独比较任意一项都会产生误导。
实测数据相当直观:Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍。这正是英伟达CUDA生态多年积累的体现。CUDA(Compute Unified Device Architecture)自2007年由英伟达推出,经过近二十年演进,形成了涵盖cuBLAS(线性代数加速)、cuDNN(深度神经网络原语)、TensorRT(推理图优化与量化)在内的完整加速库体系。这套生态不仅覆盖了底层硬件调度,更积累了数以千计经过高度调优的算子实现,使得矩阵乘法等核心操作能够逼近硬件理论峰值。AMD的ROCm平台在架构设计上与CUDA高度对应,但软件层面的精细调优积累仍需时间追赶,预填充场景对这种差距尤为敏感。
但一个关键细节值得关注:Halo这个650的成绩,几乎是Alex在同一颗芯片上去年测得速度的两倍。芯片没变,变的是软件——AMD通过直接向llama.cpp等上游开源项目贡献代码,持续推进ROCm生态成熟,这些优化正在稳步转化为实际性能增益,而无需用户手动配置底层环境。
对日常使用而言,预填充的差距基本感受不到:聊天、流式响应、在编辑器里跑Agent,基本不会触碰瓶颈。只有在超大上下文注入、纯图像和视频生成等重计算任务上才会明显。Alex的Stable Diffusion测试显示:Spark约2.9次迭代/秒,Halo仅1.3次;WAN 2.2视频生成中,五秒片段Spark约五分半钟,Halo则需75分钟。Alex同时提醒,上述测试在Windows下完成,AMD芯片在Linux下的预填充表现会有所不同。
如何解读AMD官方基准测试
AMD在官网放出了自己的对比数据,宣称Halo在多个模型上超越Spark:GLM Flash 30B的Token生成快40%,Qwen 3.5 122B快12%,GPT-OSS 120B快7%;图像生成上更是把Apple M4 Pro甩开3到7倍。

Alex对这份数据给出了冷静而专业的解读。首先值得肯定的是:AMD拿出了真实数字,而不是只给一张模糊的"感觉"对比图。但厂商基准测试本质上都是在展示自己最有利的角度,以下几点值得留意:
- 只秀Token生成,回避预填充:对比Spark时,AMD只展示了Halo强项,跳过了Spark领先三倍的预填充环节,这也间接印证了Halo的定位是折腾者而非专业重计算场景。
- 图像对比换了对手:那些3至7倍的图像生成优势,对手是Apple M4 Pro而非Spark——因为实测中Spark在图像上以2:1、视频上以16:1领先Halo。
- 偏爱MoE大模型:AMD选用了混合专家(MoE)架构模型,这类模型在128GB大内存机器上表现极佳。MoE架构由Google 2017年的论文奠基,其核心机制是路由网络(Router):在每次前向传播时,输入Token被动态分配给总专家池中的少数几个"专家"子网络进行计算,其余专家保持静默。以Qwen 3.5 122B为例,虽然参数总量高达122B,每次推理实际激活的参数仅约22B,计算量远低于同等规模稠密模型,但路由决策要求全部122B参数必须驻留内存以备随时调用。这使MoE模型呈现出"计算轻、内存重"的独特特征——128GB统一内存的Halo可完整加载此类超大模型权重,而内存受限设备则必须对模型进行量化压缩,导致精度损失和额外的反量化开销。AMD在基准测试中优先展示MoE模型,正是精准发挥大内存的差异化优势。
- 价格口径存在浮动:脚注中Spark的零售价被标为4699美元,而实际上它在4000至4700美元之间反复波动,导致"每美元Token数"的对比难以精准衡量。
x86架构:AMD Ryzen AI Halo的核心差异化优势
抛开跑分,Alex认为Halo有一个Spark无法比拟的根本优势——x86架构。
DGX Spark基于ARM(英伟达Grace CPU),只能运行ARM版Linux。而Halo是标准x86平台,Alex称这是"最高的赞美":x86意味着整套工具链无需模拟、无需寻找ARM版本,可以直接安装Visual Studio就开干。对开发者而言,这是实实在在的便利。x86架构的软件兼容性优势来自数十年的生态积累:绝大多数企业内部工具链、CI/CD系统、容器镜像和预编译二进制都默认针对x86_64构建,ARM平台即便有Rosetta等转译层,在涉及底层优化(如AVX指令集加速的数值计算库)时仍可能遭遇兼容性问题或性能折损。

Halo同时提供Windows和Linux两个版本供用户自选,买Windows版还附带激活密钥,之后照样能装Linux。而Spark只有Linux一个选择。
此外,Halo内部还集成了最高50 TOPS的NPU,这是Spark所没有的。NPU(神经处理单元)是专为低精度矩阵运算设计的定制硬件加速器,其架构针对INT8/FP16乘加运算进行了深度流水线优化,在执行Transformer中的注意力计算和前馈网络时,能效比通用GPU高出数倍。通过预装的Lemonade Server,用户可采用混合推理方案:NPU负责预填充、GPU负责解码,将计算密集的环节卸载至仅消耗约50瓦的NPU,在功耗与性能之间找到独特平衡点——尤其适合长时间后台运行的AI Agent场景,持续待机功耗的降低对散热和电费成本都有实际意义。Alex演示了DeepSeek的纯NPU版本,虽然速度不算快,但仅消耗50瓦功耗,能效比令人印象深刻。
唯一的代价是x86运行温度略高,Alex实测机器底部金属会明显发热,且四面散热孔的设计使其无法像Spark那样堆叠放置。
开箱即用:这不是去年的Strix Halo
Alex在去年评测Spark时曾批评Strix Halo平台"芯片很好,但软件还在追赶"。而这台Halo正是AMD对那句批评的正面回应。开箱通电,软件已经就绪:无需追驱动、不用为ROCm配置折腾一下午、不用猜Python版本兼容性。LM Studio、Ollama、ComfyUI、支持ROCm的Lemonade Server全部预装配置完毕。
AMD还在官网提供了分步操作手册(Playbook),按初级、中级、高级筛选,甚至包含"双Halo集群"这样的进阶玩法。Alex反复强调:"这不是你奶奶那台Strix Halo,这是全新的Strix Halo。"
综合评测结论:一场势均力敌的权衡
对本地AI折腾者而言,Ryzen AI Halo处在一个相当理想的位置。在原始性能上,这是一场各有胜负的较量:Spark拿下预填充和重计算场景,Halo则在Token生成上打平并带来更大内存容量——而Token生成速度正是日常聊天体验的直接决定因素。对于日常高频操作——聊天、Ollama、LM Studio、在VS Code里跑Agent——这台机器表现出色。
叠加x86全兼容性、Windows/Linux双系统可选、额外的NPU混合推理算力,以及开箱即用的本地AI推理软件生态,AMD这次确实在"硅片之外"大幅缩小了与英伟达的差距。至于第三类目标用户是谁,Alex卖了个关子——那将是下一期评测的主题。
核心要点
相关推荐

Go微服务实战:商城、AI Agent与IM系统集成架构详解
深入解析Go微服务架构下商城、AI Agent与IM即时通讯系统的集成方案,涵盖统一鉴权、gRPC通信、组件化Agent引擎设计、群聊机器人等生产级落地场景,适合希望掌握存量系统集成能力的Go开发者。

X平台推荐算法被曝过滤巴西选举内容,算法透明度再引争议
X平台(原Twitter)被用户发现在For You推荐流中过滤巴西选举相关内容,引发算法透明度与言论自由争议。本文深入分析事件背景、技术实现方式及对平台治理的深层影响。

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。