Vera Rubin NVL72:下一代训练基础设施意味着什么

Blog

作者:Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 是 NVIDIA 对服务器规模 GPU 限制的回应:一款专门设计的机架级机器,隐藏了电缆复杂性,将 72 个 Rubin GPU 和 36 个 Vera CPU 装入一个液冷机箱中,并在机架内部移动带宽,从而使更大的模型每瓦运行得更快。该设计改变了训练经济学的算法,同时在云服务、共置和购买自行硬件之间迫使用户做出更清晰的选择。

Vera Rubin NVL72 硬件和网络创新

NVIDIA 的产品页面和参考架构文档列出了具体的变化。GB300 NVL72 机架包含 72 个 Rubin GPU 和 36 个 Grace/Vera CPU,一个 NVLink 结构的传输速率大约为每机架 260TB/s,相当于每个 GPU 的总带宽约 3.6TB/s,以及可热插拔的 NVLink 交换机托盘,消除了长外部电缆。NVIDIA 声称与之前的 GB200 代相比,每兆瓦的令牌数量提高了多达 10 倍。该机架完全由液体冷却,常见的电力参数在 120 至 155 千瓦之间,具体取决于配置和工作负载,因此设施的电力和冷却是首要限制条件。来源:NVIDIA NVL72 产品和开发者页面,HPE 和联想 GB300 文档。

买家的实际权衡

如果您在超大规模运营,数学是简单的。每兆瓦的更高效率降低了能源支出,减少了多万亿参数训练的墙面时间。NVLink 结构减少了 GPU 之间的同步开销,这降低了紧耦合模型并行工作的训练墙钟时间。如果您是云服务提供商,这意味着每个数据中心机位的吞吐量更高。

对于企业和实验室来说,权衡使得采购决定复杂化。硬件需要定制化的电力分配、50 伏特的直流母线或多个 33 千瓦的电力架、冷却水或闭环余热回收单元,以及具备液冷机架服务经验的工作人员。这些虽然能提供更高的性能,但也增加了在小量或突发使用下难以摊销的固定设施升级。

一个明显的反对论点是供应商多样化。其他加速器和系统,如专门设计的晶圆或 Cerebras 类设备,具有不同的集成点,并可以避免 NVLink 依赖。大型云服务提供商已在生产中混合使用不同类型的加速器,从而降低了单一供应商风险。请参见大型云部署替代加速器的历史示例,以获取背景信息 Amazon 部署 Cerebras 技术的速度是其他的 25 倍

决策指南与观察到的经验

如果您需要持续、可预测的大规模训练能力,并且运营数百个机架,那么 NVL72 通常会降低每个参数的运行时间和能源成本。如果您的需求是间歇性的或限制在数十个机架内,优先租赁。共置服务商将提供中间方案,但对于足够的电力和余热回收单元容量,应预计较高的定价。

在研究机架级 NVL 系统时,我们观察到三种反复出现的操作模式。首先,电力设计成为项目的核心,而不是机架本身。其次,利用机架级 NVLink 的软件工具是实现实际吞吐量提升的关键因素。第三,安装和维修速度很重要,因为一个失败的托盘可能会停止整个多机架的作业。

NVIDIA 的 NVL72 改变了训练基础设施的重心。它更适合能够投资于校园或超大规模电力和冷却的组织,并计划利用紧密的全对全链接的软件。对于其他组织而言,合理的路径是分阶段采用:在初步规模上选择云或共置,并仅在利用率持续高且可预测时考虑有针对性的本地承诺。

爆款模板

探索我们的爆款 AI 模板,应用到你的照片上。

探索模板