[控场AI]
· 3 分钟阅读· 1,682 字

Together AI 联手 IBM Cloud 与 NVIDIA 扩展企业级推理算力

Together AI 联手 IBM Cloud 与 NVIDIA 扩展企业级推理算力

Together AI联手IBM Cloud与NVIDIA推出基于B300的企业级专用推理集群,助力开源模型生产化落地。

Together AI 宣布与 IBM Cloud 及 NVIDIA 合作,推出基于 NVIDIA B300 架构的专用推理集群,目标是让企业能够以生产规模稳定运行开源大模型。三方在此次合作中各有侧重:Together AI 负责推理栈的构建与优化,IBM Cloud 提供云基础设施,NVIDIA 提供底层硬件加速平台,形成从硬件到软件的完整闭环。专用集群相比共享资源提供更强的资源隔离与可预测性能,能够满足企业严格的 SLA 要求。此举标志着围绕开源模型的商业化服务正从单纯提供模型,向"模型+算力+运维"一体化方案演进,为更多企业在生产环境中采用开源模型打通了基础设施路径。

企业级推理进入专用集群时代

Together AI 宣布与 IBM Cloud 和 NVIDIA 达成合作,推出一套基于 NVIDIA B300 的专用推理集群,让企业能够以生产规模运行开源模型。这一举措直指当前企业落地大模型时面临的核心痛点——如何在保证性能与成本可控的前提下,稳定地将开源模型投入实际业务场景。

Together AI 联手 IBM Cloud 与 NVIDIA 扩展推理能力

对于越来越多希望摆脱闭源 API 束缚、转向自主可控开源模型的企业而言,推理算力的供给和调度能力正成为决定性因素。此次三方合作,本质上是在算力基础设施层面为开源模型的大规模部署铺路。

B300 专用集群的意义

此次合作的核心是一套由 Together AI 构建、部署在 IBM Cloud 上、基于 NVIDIA B300 的专用推理集群。相比共享资源,专用集群能够为企业提供更确定的性能表现与资源隔离保障,这对于有严格 SLA 要求的生产环境尤为关键。

B300 作为 NVIDIA 面向高吞吐推理场景的加速平台,能够支撑更大参数规模模型的实时推理需求。将其组织为专用集群,意味着企业客户不必再在算力争抢中权衡响应延迟与成本,而是可以获得稳定、可预测的推理吞吐能力。

三方分工

从公开信息看,三方在这一合作中各司其职:Together AI 负责构建与优化推理栈,IBM Cloud 提供云基础设施与企业级服务能力,NVIDIA 则提供底层硬件加速平台。这种分工组合覆盖了从硬件、云平台到推理软件的完整链条。

NVIDIA B300 是基于 Blackwell 架构的数据中心 GPU,属于 NVIDIA 新一代旗舰加速器产品线。相较于上一代 H100/H200(Hopper 架构),Blackwell 架构在推理场景下引入了 FP4 精度支持和第二代 Transformer 引擎,可在保持模型精度的前提下大幅提升每瓦性能与吞吐密度。B300 变体进一步强化了显存容量与带宽配置,使其尤其适合运行参数规模在 700B 级别的超大模型。对于企业推理场景而言,更高的显存带宽意味着更低的首 token 延迟(TTFT)和更高的每秒生成 token 数(TPS),这两项指标直接影响用户体验与系统吞吐成本。

推理栈(Inference Stack)是大模型部署中介于硬件与业务应用之间的软件层,通常涵盖模型加载与权重分片、KV Cache 管理、连续批处理(Continuous Batching)、量化推理以及请求调度等模块。Together AI 在这一领域积累了以 FlashAttention、FlashDecoding 等高性能算子为基础的优化体系,其自研的推理引擎能够充分释放底层 GPU 硬件的算力潜力。这也是 Together AI 在此次三方合作中的核心价值所在——IBM Cloud 和 NVIDIA 分别解决了"在哪里跑"和"用什么跑"的问题,而 Together AI 则解决"怎么跑得快、跑得稳"的问题。

对开源模型落地的推动

开源模型近年来在能力上快速追赶闭源方案,但企业要真正把它们用于生产,往往卡在部署与运维环节。专用推理集群的出现,降低了企业自建算力集群的门槛,使得「以生产规模运行开源模型」从理论走向可操作。

这也反映出一个趋势:围绕开源模型的商业化服务正在从单纯提供模型,转向提供「模型 + 算力 + 运维」的一体化方案。Together AI 此次与 IBM Cloud、NVIDIA 的结盟,正是这一方向的典型实践。

结语

受限于原始披露信息较为简要,关于集群的具体规模、定价模式以及支持的模型清单等细节尚不明朗。但从战略意义上看,这次合作强化了企业级开源模型推理的基础设施供给,为更多企业在生产环境中采用开源模型提供了现实路径。随着更多细节公布,其实际落地效果值得持续关注。

分享:

相关推荐