Vera Rubin NVL72: Vad nästa generations träningsinfrastruktur innebär

Blog

Av Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 är NVIDIAs svar på gränserna för serverstorlek GPU:er: en specialbyggd, rack-storleksmaskin som döljer kabelkomplexitet, packar 72 Rubin GPU:er och 36 Vera CPU:er i ett enda vätskekylt chassi, och flyttar bandbredden inuti racken så att större modeller körs snabbare per watt. Denna design förändrar matematiken för träningsekonomi samtidigt som den tvingar fram ett skarpare val mellan moln, colocering och att köpa egen hårdvara.

Vera Rubin NVL72 hårdvaru- och nätverksinnovationer

NVIDIAs produktsidor och referensarkitekturens dokumentation räknar upp de konkreta förändringarna. Ett GB300 NVL72-rack innehåller 72 Rubin GPU:er och 36 Grace/Vera CPU:er, en NVLink-struktur som har en kapacitet på ungefär 260 terabyte per sekund över racken vilket ger cirka 3,6 terabyte per sekund i all-till-all bandbredd per GPU, och hot-swappable NVLink switch-trays som tar bort långa externa kablar. NVIDIA hävdar att den ger upp till 10 gånger fler tokens per megawatt jämfört med den tidigare GB200-generationen. Racket är helt vätskekylt och de vanliga effektfigurerna ligger i intervallet 120 till 155 kilowatt beroende på konfiguration och arbetsbelastning, så anläggningens kraft och kylning är förstahandsbegränsningar. Källor: NVIDIAs NVL72 produkt- och utvecklingssidor, HPE och Lenovos GB300-dokumentation.

Praktiska avvägningar för köpare

Om du arbetar på hyperscaler-nivå är matematiken enkel. Högre effektivitet per megawatt minskar energikostnaderna och minskar väggtid för träning med mångbiljoner parametrar. NVLink-strukturen minskar överhängen av inter-GPU-synkronisering, vilket sänker träningens väggklock-tid för tätt kopplade modell-parallell-arbeten. Om du är ett moln, översätts detta till mer genomströmning per datacenterbåge.

För företag och labb komplicerar avvägningarna acquisitionsbesluten. Hårdvaran kräver skräddarsydd distributionskraft, 50 volt DC busbars eller flera 33 kW krafthyllor, kylt vatten eller stängda slussar CDUs, och personal med erfarenhet av vätskekylda racktjänster. Dessa möjliggör prestanda men lägger till fasta anläggningsuppgraderingar som är svåra att avskriva under liten eller sporadisk användning.

Ett uppenbart motargument är leverantörsdiversifiering. Alternativa acceleratorer och system såsom specialbyggda wafers eller Cerebras-klass apparater har olika integrationspunkter och kan undvika NVLink-beroende. Stora molnleverantörer har redan blandat acceleratorer i produktion, vilket minskar risken för enskilda leverantörer. Se det historiska exemplet på stora molndistributioner av alternativa acceleratorer för kontext Amazon deploys Cerebras technology 25 times faster than.

Beslutsguide och observerade lärdomar

Om du behöver sustained, förutsägbar storskalig träningskapacitet och driver hundratals rack, kommer NVL72-vägen vanligtvis att sänka körningstid och energikostnad per parameter. Om dina behov är intermittenta eller begränsade till dussintals rack, hyr först. Coloceringstjänster kommer att erbjuda mittpunkter men förvänta dig premiumpriser för tillräcklig kraft och CDU-kapacitet.

Vi har observerat tre återkommande operativa mönster när vi studerade rack-stora NVL-system. För det första, kraftdesign blir projektet, inte racket. För det andra, mjukvaruverktyg som utnyttjar rack-nivå NVLink är den begränsande faktorn för verkliga genomströmningsvinster. För det tredje, installations- och servicehastighet är viktigt eftersom en enda misslyckad tray kan stoppa ett flerrackjob.

NVIDIAs NVL72 förändrar tyngdpunkten för träningsinfrastruktur. Den gynnar organisationer som kan investera i campus- eller hyperskalig kraft och kylning och som planerar mjukvara för att använda täta all-till-all-länkar. För alla andra är den rimliga vägen gradvis adoption: moln eller colocation för initial skala och ett riktat on-prem åtagande först när användningen förblir hög och förutsägbar.

Virala mallar

Utforska våra virala AI-mallar och applicera dem på dina foton.

Utforska mallar