MiniMax H3 云端GPU实测:四家平台四张卡的每秒与每美元成本对比

同权重同种子实测:4090竞价实例比H100便宜近三倍,短任务成本大头在冷启动而非推理本身
一位开发者在四家云GPU平台(Vast.ai、Hyperstack、RunPod、Nebius)上,以完全相同的权重、计算图和随机种子运行MiniMax H3文生视频任务,总花费1.67美元,系统对比了RTX 4090、H100 PCIe、L40S三种GPU的速度与成本。结果显示:稳态成本上Vast.ai的4090竞价实例最低(每段0.013美元),比H100便宜近三倍;L40S速度与4090持平(3.97秒/步),未达H100水平(2.99秒/步)。4090依靠ComfyUI动态显存流式加载运行34GB DiT,但需68GB主机内存支撑。对短任务而言,67GB权重下载、冷启动与实例销毁的会话开销才是成本主体,RunPod在这方面表现最优(每段0.07美元)。测试结论指向一个反直觉的规律:int8量化工作负载下,消费级显卡配合充足内存往往比旗舰数据中心卡更具成本优势。
在文本生成视频(T2V)逐渐进入实用阶段的当下,模型跑得快不快、花钱多不多,已经成为开发者选型时最现实的考量。一位正在围绕该模型构建服务的开发者,在 Reddit 上公开了一组自费实测数据:用完全相同的权重、计算图和随机种子,在四家云 GPU 平台的四种显卡上运行 MiniMax H3 文生视频任务,逐帧记录了每段视频的耗时与花费。整套测试总成本仅 1.67 美元,但披露的细节值得同行细读。
需要说明的是,作者坦言自己是利益相关方(正在做相关服务),但所有数字均来自实际付费运行,且提供了原始 CSV 数据供核验。这种透明度让这份对比具备了参考价值。

测试方法:把变量控制到极致
这份测试最大的价值在于严格的变量控制。任务本身是固定的:MiniMax H3 文生视频,单段 5 秒、864x480 分辨率(模板中 0.4 MP 那一档),20 步采样,使用 ComfyUI v0.35.0 的标准 T2V 计算图和官方 int8_convrot 权重。
权重体量相当可观——34 GB 的 DiT 主干、27 GB 的 Qwen3-VL 编码器,加上 VAE,总计 67 GB。测试没有使用任何 LoRA 或参考帧,所有显卡跑的是同样的提示词和种子,全程采用 torch cu130,以确保 int8 内核是原生版本而非模拟路径。
每张卡跑三段视频。作者用两个概念区分成本口径:**steady(稳态)**是第 2、3 段视频的平均值,按实际支付费率计算(含磁盘和公网 IP);**session(整段会话)**则是平台对整个流程的全部计费——镜像拉取、67 GB 下载、首段冷启动、以及实例销毁前的空转分钟——除以三段视频。这个区分对短任务尤为关键。
四家平台四张卡:谁快谁便宜
实测结果如下:
| 平台 | 显卡 | vCPU/内存 | 每段秒数 | 稳态每段$ | 会话每段$ |
|---|---|---|---|---|---|
| Vast.ai(竞价 $0.40/h) | RTX 4090 24GB | 32/108GB | 93 | $0.013 | $0.17 |
| Hyperstack(竞价 $2.00/h) | H100 PCIe 80GB | 28/177GB | 67 | $0.038 | $0.13 |
| RunPod Secure($0.74/h) | RTX 4090 24GB | 15/86GB | 92 | $0.019 | $0.07 |
| Nebius(可抢占 $0.92/h) | L40S 48GB | 24/94GB | 89 | $0.024 | $0.19 |
从稳态成本看,Vast.ai 的 RTX 4090 竞价实例以每段 0.013 美元领跑,性价比惊人。而从会话成本看,RunPod 反而以 0.07 美元最低——因为它的整体流程开销控制得更好。
这组数据揭示了一个反直觉的现象:单看每段视频的稳态花费,消费级的 4090 竟然比数据中心级的 H100 便宜近三倍,因为 H100 的租用单价远高于其速度带来的优势。对短片段渲染这类任务,H100 的算力优势并不足以覆盖它昂贵的时租。
两个让人意外的发现
作者特别点出两个出乎意料的结果。
第一,L40S 的表现更接近 4090 而非 H100。在两张 24 GB 卡和 L40S 上,每步耗时都是 3.97 秒,而 H100 PCIe 只需 2.99 秒。也就是说,L40S 虽然定位在 4090 之上,但在这个 int8 工作负载里并没有跑出对应的速度优势。
第二,4090 靠 ComfyUI 的动态 VRAM 路径硬扛下了 34 GB 的 DiT。24 GB 的显卡通过将权重流式加载,实际只占用 23 GB 显存,代价是吃掉 68 GB 主机内存。这意味着官方文档里"≥ 64 GB RAM"的要求绝非建议——四台主机中有三台内存峰值都摸到了 68 GB。想在消费级显卡上跑这个模型,内存是硬门槛。
短任务的钱花在了哪里
对于按需租用、只跑几段视频的短任务来说,成本大头往往不在推理本身,而在会话开销上。
67 GB 的权重下载速度在各平台差异巨大:Vast 主机跑到 450 MB/s,Hyperstack 370,RunPod 210,Nebius 只有 104 MB/s。下载慢意味着实例空转计费的时间更长。
Nebius 的问题尤其突出——首段视频耗时长达 11.5 分钟,原因是权重需要从网络磁盘回读,而其他平台的冷启动只需 1.8 到 2.7 分钟。此外,任务结束后负责销毁实例的看门狗进程,各平台都会再额外计费 2 到 3 分钟。
还有一点值得注意:稳态数字不包含文本编码器的开销(因为提示词相同,被 ComfyUI 缓存了)。换一个新提示词,每段视频会额外增加 15 到 25 秒。这对需要频繁切换提示词的实际生产场景是个不小的隐性成本。
对实际选型的启示
这份测试给做视频生成服务或个人跑图的用户提供了几条清晰的经验。
如果是持续、批量的长任务,稳态成本占主导,此时 Vast.ai 的 4090 竞价实例最划算。如果是零散的短任务,会话开销才是关键,需要选择镜像拉取快、权重加载快、销毁计费短的平台,RunPod 在这方面表现最佳。
更宏观的一点是:在文生视频这类 int8 量化工作负载上,堆砌昂贵的旗舰算力未必划算,消费级显卡配合足够的主机内存和成熟的显存流式方案,反而能在成本上取得优势。当然,作者作为服务提供方的身份提醒我们,这类横评仍需结合自身工作负载复现验证——好在他已经把逐节点计时、nvidia-smi 追踪和原始 CSV 都公开了。


