Vera Rubin NVL72: Ko nozīmē nākamās paaudzes apmācību infrastruktūra
Autors: Win.AI Editorial

Vera Rubin NVL72 ir NVIDIA atbilde uz serveru mēroga GPU ierobežojumiem: mērķtiecīgi veidota, rack-mēroga mašīna, kas slēpj kabeļu sarežģījumus, ietver 72 Rubin GPU un 36 Vera CPU vienā šķidrumu dzesētā korpusā un pārvieto joslas platumu rack iekšienē, lai lielāki modeļi darbotos ātrāk uz vatu. Šis dizains maina apmācību ekonomikas aprēķinus, piespiežot izvēlēties starp mākoņiem, kolokāciju un savu aparatūru.
Vera Rubin NVL72 aparatūras un tīkla inovācijas
NVIDIA produktu lapas un atsauces arhitektūras dokumentācija uzskaita konkrētās izmaiņas. GB300 NVL72 rack satur 72 Rubin GPU un 36 Grace/Vera CPU, NVLink audums, kas ir novērtēts apmēram 260 terabitu sekundē visā rack, kas atbilst apmēram 3.6 terabitu sekundē visiem visam joslas platumam uz GPU, un karstās maiņas NVLink slēdžu trauki, kas izslēdz garas ārējās kabeļus. NVIDIA apgalvo, ka ir iespējams iegūt līdz pat 10 reizēm vairāk tokenu uz megavatu salīdzinājumā ar iepriekšējo GB200 paaudzi. Rack ir pilnībā šķidrumu dzesēts, un bieži citējamie jaudas rādītāji atrodas 120 līdz 155 kilovatu diapazonā atkarībā no konfigurācijas un slodzes, tāpēc objekta jauda un dzesēšana ir pirmās pakāpes ierobežojumi. Avoti: NVIDIA NVL72 produktu un izstrādātāju lapas, HPE un Lenovo GB300 dokumentācija.
Praktiski kompromisi pircējiem
Ja Jūs darbojaties hiperskalā, matemātika ir vienkārša. Augstāka efektivitāte uz megavatu samazina enerģijas izdevumus un samazina laiku starp multi-triljonu parametru apmācību procesiem. NVLink audums samazina starp-GPU sinhronizācijas pārklājumu, kas samazina apmācību laiku stingri saistītā modeļu paralēlajā darbā. Ja Jūs esat mākoņpakalpojumu sniedzējs, tas nozīmē lielāku caurskatāmību katrā datu centra nodalījumā.
Uzņēmumiem un laboratorijām kompromisi sarežģo iegādes lēmumus. Aparatūra prasa pielāgotu jaudas sadali, 50 voltu DC starplīnijas vai vairākas 33 kW jaudas plauktus, dzesētu ūdeni vai slēgtā apļa CDU, un personālu ar pieredzi šķidrumu dzesētu rack servisos. Tie ļauj panākt veiktspēju, bet pievieno fiksētus objekta uzlabojumus, kurus ir grūti amortizēt nelielā vai nestabilā lietošanā.
Viens acīmredzams pretarguments ir piegādātāju dažādošana. Alternatīvie paātrinātāji un sistēmas, piemēram, mērķtiecīgi veidoti čipi vai Cerebras klasē ierīces, ir ar atšķirīgiem integrēšanas punktiem un var izvairīties no NVLink atkarības. Lieli mākoņu pakalpojumu sniedzēji jau ir sajaukuši paātrinātāju tipus ražošanā, kas samazina risku, ka viss ir no viena piegādātāja. Skatiet vēsturisko piemēru par lieliem mākoņu izvietojumiem ar alternatīviem paātrinātājiem kā kontekstu Amazon deploys Cerebras technology 25 times faster than.
Lēmumu ceļvedis un novēroti mācību procesi
Ja Jums nepieciešama ilgtspējīga, prognozējama liela mēroga apmācību jauda un Jūs darbojaties simtiem rack, NVL72 ceļš parasti samazinās izpildes laiku un enerģijas izmaksas uz parametru. Ja Jūsu vajadzības ir pārtrauktas vai ierobežotas līdz desmitiem rack, vispirms nomājiet. Kolokācijas pakalpojumu sniedzēji piedāvās vidusceļus, bet sagaidiet augstākas cenas par pietiekamu jaudu un CDU kapacitāti.
Pētījuma laikā par rack-mēroga NVL sistēmām novērojām trīs atkārtojošos operatīvos modeļus. Pirmkārt, jaudas dizains kļūst par projektu, nevis par rack. Otrkārt, programmatūras rīki, kas izmanto rack-līmeņa NVLink, ir faktors, kas ierobežo reālo caurskatāmību. Treškārt, uzstādīšanas un apkalpošanas ātrums ir svarīgs, jo viena neveiksmīga tbase var apturēt vairāku rack darbu.
NVIDIA NVL72 maina gravitātes centru apmācību infrastruktūrā. Tas dod priekšroku organizācijām, kas var ieguldīt campus vai hiperskalas jaudā un dzesēšanā, un plāno programmatūru izmantot ciešas savienojuma saites. Visām pārējām saprātīgs ceļš ir pakāpeniska pieņemšana: mākonis vai kolokācija sākotnējai mērogai un mērķtiecīga saistība tikai tad, kad izmantošana paliek augsta un prognozējama.




