Vera Rubin NVL72: Wat next gen trainingsinfrastructuur betekent

Blog

Door Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 is NVIDIA’s antwoord op de grenzen van server-schaal GPU's: een speciaal gebouwde, rack-schaal machine die kabelcomplexiteit verbergt, 72 Rubin GPU's en 36 Vera CPU's in een enkele vloeistofgekoelde behuizing plaatst en de bandbreedte binnen het rack verplaatst zodat grotere modellen sneller draaien per watt. Dit ontwerp verandert de rekensom van trainingseconomieën terwijl het een scherpere keuze afdwingt tussen cloud, colocatie en het kopen van je eigen hardware.

Vera Rubin NVL72 hardware- en netwerknieuwigheden

NVIDIA’s productpagina's en documentatie over referentiearchitectuur sommen de concrete veranderingen op. Een GB300 NVL72 rack bevat 72 Rubin GPU's en 36 Grace/Vera CPU's, een NVLink-fabric dat ongeveer 260 terabytes per seconde door het rack levert, wat neerkomt op ongeveer 3,6 terabytes per seconde aan all-to-all bandbreedte per GPU, en hot-swappable NVLink-switch trays die lange externe kabels verwijderen. NVIDIA beweert tot 10 keer meer tokens per megawatt in vergelijking met de vorige GB200 generatie. Het rack is volledig vloeistofgekoeld en de vaak geciteerde vermogenscijfers liggen in de range van 120 tot 155 kilowatt, afhankelijk van de configuratie en werklast, dus de stroomvoorziening en koeling van de faciliteit zijn eerste-orde beperkingen. Bronnen: NVIDIA NVL72 product- en ontwikkelaarspagina's, HPE en Lenovo GB300 documentatie.

Praktische afwegingen voor kopers

Als je op hyperscaler-schaal werkt, is de rekensom eenvoudig. Hogere efficiëntie per megawatt vermindert de energiekosten en verkort de wandtijd voor training runs met meerdere triljoen parameters. De NVLink-fabric vermindert de overhead voor inter-GPU synchronisatie, wat de wandklok tijd voor strak gekoppeld model parallel werk verlaagt. Als je een cloud bent, vertaalt dat zich in meer doorvoer per datacenter bay.

Voor bedrijven en laboratoria compliceren de afwegingen de acquisitiebeslissingen. De hardware vereist op maat gemaakte stroomdistributie, 50 volt DC busbars of meerdere 33 kW stroomrekken, gekoeld water of gesloten loop CDUs, en personeel met ervaring in vloeistofgekoelde rackservice. Deze zorgen voor prestaties maar voegen vaste faciliteitsupgrade toe die moeilijk te amortiseren zijn onder kleine of fluctuerende gebruik.

Een voor de hand liggend tegenargument is leverancierdiversificatie. Alternatieve versnellers en systemen zoals speciaal gebouwde wafers of Cerebras-klasse apparaten hebben verschillende integratiepunten en kunnen NVLink-afhankelijkheid vermijden. Grote cloudproviders hebben al verschillende soorten versnellers in productie gemengd, wat het risico van een enkele leverancier vermindert. Zie het historische voorbeeld van grote cloudimplementaties van alternatieve versnellers voor context Amazon implementeert Cerebras-technologie 25 keer sneller dan.

Beslissingsgids en geobserveerde lessen

Als je duurzame, voorspelbare grootschalige trainingscapaciteit nodig hebt en honderden racks beheert, zal de NVL72-route meestal de looptijd en energiekosten per parameter verlagen. Als je behoeften intermitterend zijn of beperkt tot tientallen racks, huur dan eerst. Colocatieproviders zullen middenpunten aanbieden, maar verwacht premiumprijzen voor voldoende vermogen en CDU-capaciteit.

We hebben drie terugkerende operationele patronen geobserveerd bij het bestuderen van rack-schaal NVL-systemen. Ten eerste, het stroomontwerp wordt het project, niet het rack. Ten tweede, softwaretools die rack-niveau NVLink benutten, vormen de beperkende factor voor echte doorvoervooruitgangen. Ten derde, installatie- en servicessnelheid is belangrijk omdat een enkele defecte tray een multi-rack taak kan stoppen.

NVIDIA’s NVL72 verandert het zwaartepunt voor trainingsinfrastructuur. Het bevoordeelt organisaties die kunnen investeren in campus- of hyperschaal stroom en koeling en die software plannen om strakke all-to-all verbindingen te gebruiken. Voor iedereen die niet aan deze voorwaarden voldoet, is de praktische weg gefaseerde adoptie: cloud of colocatie voor initiële schaal en een gerichte on-premise verbintenis alleen wanneer de benutting hoog en voorspelbaar blijft.

Virale sjablonen

Ontdek onze virale AI-sjablonen en pas ze toe op je foto's.

Sjablonen ontdekken