Vera Rubin NVL72: Ce que signifie l'infrastructure de formation de nouvelle génération
Par Win.AI Editorial

Vera Rubin NVL72 est la réponse d'NVIDIA aux limites des GPU à l'échelle serveur: une machine conçue sur mesure, à l'échelle du rack qui cache la complexité des câbles, embarque 72 GPU Rubin et 36 CPU Vera dans un seul châssis refroidi par liquide, et déplace la bande passante à l'intérieur du rack afin que des modèles plus volumineux fonctionnent plus rapidement par watt. Ce design change l'arithmétique des économies d'entraînement tout en imposant un choix plus net entre le cloud, la colocation et l'achat de votre propre matériel.
Innovations matérielles et réseaux de Vera Rubin NVL72
Les pages produits et la documentation architecturale de référence d'NVIDIA énumèrent les changements concrets. Un rack GB300 NVL72 contient 72 GPU Rubin et 36 CPU Grace/Vera, un tissu NVLink évalué à environ 260 téraoctets par seconde à travers le rack, ce qui revient à environ 3,6 téraoctets par seconde de bande passante totale par GPU, et des plateaux de commutation NVLink hot-swappables qui éliminent les longs câbles externes. NVIDIA affirme jusqu'à 10 fois plus de tokens par mégawatt par rapport à la génération précédente GB200. Le rack est entièrement refroidi par liquide et les chiffres de puissance généralement cités s'élèvent dans la gamme de 120 à 155 kilowatts selon la configuration et la charge de travail, donc l'alimentation et le refroidissement des installations sont des contraintes de premier ordre. Sources: pages produits et développeurs NVIDIA NVL72, documentation GB300 d'HPE et de Lenovo.
Compromis pratiques pour les acheteurs
Si vous opérez à l'échelle hyperscale, les calculs sont simples. Une efficacité supérieure par mégawatt réduit les dépenses énergétiques et diminue le temps d'attente pour des entraînements multi-trillions de paramètres. Le tissu NVLink réduit la surcharge de synchronisation inter-GPU, ce qui diminue le temps de mur de l'horloge d'entraînement pour un travail de parallélisme parallèle de modèle étroitement couplé. Si vous êtes un fournisseur de cloud, cela se traduit par un meilleur débit par baie de centre de données.
Pour les entreprises et les laboratoires, les compromis compliquent les décisions d'acquisition. Le matériel exige une distribution électrique sur mesure, des barres omnibus CC de 50 volts ou plusieurs étagères d'alimentation de 33 kW, de l'eau glacée ou des CDU à boucle fermée, et un personnel expérimenté dans le service rack refroidi par liquide. Ces éléments permettent des performances mais ajoutent des mises à niveau fixes d'installations qui sont difficiles à amortir sous une utilisation faible ou épisodique.
Un contre-argument évident est la diversification des fournisseurs. Des accélérateurs alternatifs et des systèmes tels que des wafers conçus sur mesure ou des appareils de type Cerebras ont des points d'intégration différents et peuvent éviter la dépendance à NVLink. Les grands fournisseurs de cloud ont déjà mélangé des types d'accélérateurs en production, ce qui réduit le risque d'un unique vendeur. Voir l'exemple historique de grands déploiements de cloud d'accélérateurs alternatifs pour le contexte Amazon déploie la technologie Cerebras 25 fois plus rapidement que.
Guide de décision et leçons observées
Si vous avez besoin d'une capacité d'entraînement à grande échelle soutenue et prévisible et que vous exploitez des centaines de racks, le chemin NVL72 diminuera généralement le temps d'exécution et le coût énergétique par paramètre. Si vos besoins sont intermittents ou limités à des dizaines de racks, louez d'abord. Les fournisseurs de colocation offriront des points intermédiaires mais attendez-vous à des prix premium pour une puissance et une capacité de CDU suffisantes.
Nous avons observé trois schémas opérationnels récurrents lors de l'étude des systèmes NVL à l'échelle du rack. Premièrement, la conception de l'alimentation devient le projet, pas le rack. Deuxièmement, les outils logiciels qui exploitent le NVLink au niveau du rack sont le facteur limitant pour des gains de débit réels. Troisièmement, la vitesse d'installation et de service compte car un seul plateau défaillant peut arrêter un travail de plusieurs racks.
Le NVL72 d'NVIDIA change le centre de gravité de l'infrastructure de formation. Il favorise les organisations qui peuvent investir dans le pouvoir et le refroidissement à l'échelle du campus ou hyperscale et qui prévoient un logiciel pour utiliser des liens serrés de tous à tous. Pour tout le monde, le chemin sensé est l'adoption progressive: cloud ou colocation pour l'échelle initiale et un engagement ciblé sur site seulement une fois que l'utilisation reste élevée et prévisible.




