Vera Rubin NVL72: Ce înseamnă infrastructura de antrenament de generație următoare
De Win.AI Editorial

Vera Rubin NVL72 este răspunsul NVIDIA la limitele GPU-urilor de dimensiuni server: o mașină construită special, la nivel de rack, care ascunde complexitatea cablurilor, înghesuie 72 GPU-uri Rubin și 36 CPU-uri Vera într-un singur șasiu răcitor cu lichid și mută lățimea de bandă în interiorul rack-ului, astfel încât modelele mai mari să ruleze mai rapid pe watt. Această design schimbă aritmetica economiei de antrenament, forțând o alegere mai clară între cloud, colocalizare și achiziționarea propriului hardware.
Inovații hardware și de rețea în Vera Rubin NVL72
Paginiile de produs NVIDIA și documentația despre arhitectura de referință enumeră schimbările concrete. Un rack GB300 NVL72 conține 72 GPU-uri Rubin și 36 CPU-uri Grace/Vera, o structură NVLink evaluată la aproximativ 260 de terabytes pe secundă în întregul rack, ceea ce se traduce prin aproximativ 3.6 terabytes pe secundă de lățime de bandă all-to-all per GPU și tăvi de comutatoare NVLink care pot fi schimbate fără a opri sistemul, eliminând cablurile externe lungi. NVIDIA susține că oferă de până la 10 ori mai multe token-uri pe megawatt comparativ cu generația anterioară GB200. Rack-ul este complet răcit cu lichid, iar cifrele de putere comun utilizate variază între 120 și 155 de kilowați, în funcție de configurație și sarcină de lucru, astfel că puterea și răcirea facilității sunt constrângeri de prim ordin. Surse: paginile de produs și dezvoltare NVIDIA NVL72, documentația HPE și Lenovo GB300.
Compromisuri practice pentru cumpărători
Dacă operezi la scară de hyperscaler, calculul este simplu. O eficiență mai mare pe megawatt reduce cheltuielile cu energia și reduce timpul de așteptare pentru antrenamentele cu parametrii multi-trilion. Structura NVLink reduce suprapunerile de sincronizare între GPU-uri, ceea ce scade timpul real de ceas al antrenamentului pentru munca paralelă strâns legată. Dacă ești un serviciu cloud, aceasta se traduce printr-un throughput mai mare pe fiecare raft de centru de date.
Pentru întreprinderi și laboratoare, compromisurile complică deciziile de achiziție. Hardware-ul necesită o distribuție de energie personalizată, bare de distribuție DC de 50 de volți sau rafturi de putere de 33 kW multiple, apă răcită sau CD-uri în circuit închis, precum și personal cu experiență în service-ul rack-urilor răcite cu lichid. Acestea facilitează performanța, dar adaugă upgrade-uri fixe ale facilității care sunt greu de amortizat în utilizarea mică sau sporadică.
Un contraargument evident este diversificarea furnizorilor. Acceleratoarele alternative și sistemele, cum ar fi plăcile personalizate sau aparatele de tip Cerebras, au puncte de integrare diferite și pot evita dependența de NVLink. Marii furnizori de cloud au amestecat deja tipuri de acceleratoare în producție, ceea ce reduce riscul unui singur furnizor. Vezi exemplul istoric al desfășurărilor mari de cloud cu acceleratoare alternative pentru context Amazon desfășoară tehnologia Cerebras de 25 de ori mai repede decât.
Ghid de decizie și lecții observate
Dacă ai nevoie de capacitate de antrenament de mare amploare, sustenabilă și previzibilă, și operezi sute de rack-uri, calea NVL72 va reduce de obicei timpul de rulare și costul energiei per parametru. Dacă nevoile tale sunt intermitente sau limitate la zeci de rack-uri, închiriază mai întâi. Furnizorii de colocalizare vor oferi puncte intermediare, dar așteaptă tarife premium pentru suficientă putere și capacitate CD.
Am observat trei tipare operaționale recurente în timp ce studiam sistemele NVL cu nivel de rack. În primul rând, designul energiei devine proiectul, nu rack-ul. În al doilea rând, instrumentele software care valorifică NVLink la nivel de rack sunt factorul limitativ pentru câștiguri reale de throughput. În al treilea rând, viteza de instalare și service contează pentru că un singur tray defect poate opri o sarcină distributivă pe mai multe rack-uri.
NVL72 de la NVIDIA schimbă centrul de greutate pentru infrastructura de antrenament. Favorizează organizațiile care pot investi în puterea și răcirea de campus sau hyperscale și care planifică software-ul să utilizeze legături all-to-all strâns integrate. Pentru toți ceilalți, calea sensibilă este adoptarea etapizată: cloud sau colocalizare pentru scalarea inițială și un angajament pe site țintit doar după ce utilizarea rămâne ridicată și previzibilă.




