768GB显存低于单张RTX 6000:多卡拼装本地大模型实录

极客用12张挖矿显卡拼出768GB显存,成本低于单张专业卡,重燃本地部署大模型争论。
一位硬件爱好者用12张基于GA100架构的二手矿卡CMP170HX,以低于单张RTX 6000 Pro的总价拼出了768GB HBM2e显存,并通过光纤RPC与第二台设备组成集群。该系统已能运行GLM、Qwen3、DeepSeek Flash、KimiK等主流开源大模型,使用vLLM和llama.cpp作为推理框架。此案例再次引发本地部署与云端API之间的经典争论:前者具备数据私有、不受限流约束、可自由调参的优势,后者则在低频轻量场景下成本更优。作者认为以太坊挖矿退潮释放的二手算力卡提供了低成本入场窗口,但也坦承矿卡在驱动支持、PCIe带宽及多卡软件适配上存在明显短板,门槛对普通用户仍然不低。
一位长期活跃在硬件社区的极客晒出了自己的最新装机成果:用 12 张 64GB 的 CMP170HX 拼出了 768GB 显存,总花费还低于一张 RTX 6000 Pro 的价格。这个方案再次点燃了关于「本地跑大模型到底值不值」的老争论。
用矿卡堆出768GB显存
这套配置的核心是 12 块 CMP170HX。这是 NVIDIA 面向加密货币挖矿推出的计算卡,基于 GA100 架构,配备 HBM2e 显存,二手市场上价格相对亲民。作者通过多卡并联的方式,把单卡的 64GB 累加到了 768GB 的总显存池。

值得关注的是成本对比。RTX 6000 Pro 属于专业级工作站显卡,单卡售价高昂,且显存容量远不及这套多卡方案。作者强调,整套装机预算「低于一张 RTX 6000 Pro」,却换来了数倍于单卡的显存空间——这正是本地部署超大模型的关键瓶颈所在。
为进一步扩展内存,作者还通过光纤连接将这套设备与另一台机器组成 RPC(远程过程调用)集群,在需要更大显存时可以调度两台设备的资源协同工作。
CMP(Cryptocurrency Mining Processor)是NVIDIA专为挖矿市场推出的产品线,刻意屏蔽了视频输出接口并削减了部分图形功能,以此区隔消费级显卡市场。CMP170HX基于A100同款的GA100核心,搭载HBM2e(High Bandwidth Memory 2e)显存,单卡带宽高达1.5TB/s,远超GDDR6X方案。HBM2e将多层DRAM芯片垂直堆叠并通过硅中介层与GPU直连,在提供大容量的同时兼顾了极高的带宽密度——这正是大模型推理时批量矩阵运算所需要的特性。GA100本是数据中心计算卡A100的核心,CMP170HX的出现使得这颗芯片以相对低廉的二手价格流入消费市场,成为预算有限的本地部署爱好者的「捡漏」对象。
能跑哪些模型
作者列出了这套系统实际运行的模型阵容,涵盖了当下主流的开源大模型系列,包括 GLM、DeepSeek广告 Flash 系列、Qwen3 系列、KimiK 以及 MiniMax 等。推理框架方面,他使用 vLLM 和 llama.cpp 两套主流工具。
对于大显存的意义,作者的表述很直接:单张 RTX 6000 或者 M3 Mac Studio 都难以承载这种规模的模型加载需求。显存容量决定了能装下多大的模型权重,而多卡堆叠正是绕开单卡显存上限的经济路径。
他还提到,自从搭好这套系统后就很少发帖了,因为「跟自己的机器聊天比发帖更有意思」——这句调侃背后,反映出本地大模型在响应速度和私密性上的独特体验。
vLLM是UC Berkeley开发的高吞吐量LLM推理框架,核心创新是PagedAttention机制——借鉴操作系统虚拟内存的分页思想,将KV Cache(键值缓存)切分为固定大小的块进行动态分配,显著减少显存碎片化,从而在相同显存下支持更大的并发批次。llama.cpp则是以纯C/C++实现的轻量级推理引擎,最初针对CPU优化,后扩展支持CUDA、Metal等多种后端,以极低的依赖和灵活的量化支持著称。两套框架各有侧重:vLLM更适合追求高吞吐的服务化部署,llama.cpp则在资源受限或需要精细控制量化精度的场景下更为灵活。在多卡矿卡这类非标准配置上,llama.cpp的适配难度通常低于vLLM。
本地部署 vs API:老争论再起
这类帖子几乎必然引发一个经典分歧:既然有现成的云端 API,为什么还要花大价钱堆硬件?
作者在帖中提前「预判」了质疑者的三大论点:
- API 更便宜:调用云端服务按量付费,短期成本低
- 回本周期漫长:有人调侃这套硬件「要 52 光年才能回本」
- 噪音与电费:多卡满载运行的功耗和散热确实是现实成本
对此作者的态度是「NOT」——他并不认同这些反对意见。从实际使用角度看,本地部署确实有 API 无法替代的价值:数据完全私有、不受服务商限流和价格波动影响、可以自由折腾模型和参数。当然,API 派的观点也有其道理,对于低频、轻量的使用场景,云端调用的性价比通常更高。
这场争论本质上没有标准答案,取决于使用者的需求强度、隐私要求和折腾意愿。
抓住算力机会的窗口
帖子结尾,作者给出了一段颇具投资视角的观点:算力需求在可预见的未来会持续高涨,二手计算卡市场时不时会冒出好机会,关键是保持关注、看准时机果断出手。
这个判断有其合理性。随着开源大模型能力不断逼近闭源产品,本地部署的动机越来越强,而挖矿退潮释放出的大量计算卡为预算有限的爱好者提供了低成本入场的窗口。CMP170HX 这类原本用于挖矿的卡,如今在推理场景下找到了新的用武之地。
不过需要提醒的是,这类矿卡方案也有明显短板:CMP 系列显卡在视频输出、驱动支持、PCIe 带宽等方面存在阉割,多卡并联的软件适配和稳定性调优需要相当的动手能力,并非即插即用。对普通用户而言,门槛依然不低。
所谓「挖矿退潮」主要指2022年以太坊完成从工作量证明(PoW)到权益证明(PoS)的「合并」(The Merge)后,GPU挖矿的主要需求场景消失,大量专用矿卡与消费级显卡集中流入二手市场,价格大幅下探。CMP170HX等算力卡正是在这一背景下获得了性价比窗口。不过这个窗口并非永久开放——随着AI推理需求的持续增长,二手算力卡价格已呈现回升趋势,且优质机器的供给存在消耗性,未来捡漏难度只会越来越高。
写在最后
这套 768GB 显存的装机方案,是硬件爱好者在成本约束下追求极致的一个生动样本。它未必适合所有人复制,但它揭示了一个趋势:随着开源大模型的爆发,本地算力的玩法正变得越来越多元。对于愿意折腾、看重数据自主权的用户来说,二手计算卡堆显存不失为一条值得研究的路径。
相关推荐

只想要一个自定义域名邮箱,为何如此艰难?
拥有一个自定义域名邮箱看似简单,实则涉及 SPF/DKIM/DMARC 配置、IP 信誉、托管服务成本等诸多难题。本文梳理自建与托管方案的权衡,并给出实用建议。

Claude意外帮用户发现燃气泄漏:AI助手的安全应用边界
一位Reddit用户借助AI助手Claude识别出家中燃气泄漏隐患,PG&E上门确认并修复。本文分析AI助手在家庭安全场景中的真实价值与使用边界,以及处理燃气泄漏的正确做法。

Gemini 4 Argon发布:谷歌重返前沿,但故事没那么简单
谷歌时隔半年发布前沿模型Gemini 4 Argon,跑分重返一线却暂不开放。本文解析其基准表现、与Sonnet 5.5的竞争,以及模型能力与产品体验之争。