Vera Rubin NVL72: Šta znači infra za obuku naredne generacije
Аутор: Win.AI Editorial

Vera Rubin NVL72 je NVIDIA-ino rešenje za ograničenja GPU-ova na nivou servera: mašina napravljena za svrhu, na nivou ormara, koja skriva složenost kablova, sadrži 72 Rubin GPU-a i 36 Vera CPU-a u jednoj tečno hlađenoj šasiji, i premesta propusnost unutar ormara tako da veći modeli brže rade po vatu. Ovaj dizajn menja aritmetiku ekonomike obuke, dok prisiljava oštriji izbor između oblaka, kolokacije i kupovine vlastitog hardvera.
Inovacije u hardveru i mreži Vera Rubin NVL72
NVIDIA-ine stranice proizvoda i dokumentacija o referentnoj arhitekturi navode konkretne promene. GB300 NVL72 ormar sadrži 72 Rubin GPU-a i 36 Grace/Vera CPU-a, NVLink tkanina ocenjena na približno 260 terabajta po sekundi kroz ormar što iznosi oko 3,6 terabajta po sekundi propusnosti za svaki GPU, i vruće zamjenjive NVLink prekidače koji uklanjaju duge spoljne kablove. NVIDIA tvrdi da omogućava do 10 puta više tokena po megavatu u poređenju sa prethodnom generacijom GB200. Ormar je potpuno tečno hlađen, a uobičajene brojke o potrošnji struje kreću se u rasponu od 120 do 155 kilovata, u zavisnosti od konfiguracije i opterećenja, pa su snaga objekta i hlađenje ograničenja prvog reda. Izvori: NVIDIA NVL72 produktne i developerske stranice, HPE i Lenovo GB300 dokumentacija.
Praktične kompromise za kupce
Ako radite na skali hiperskalera, matematika je jednostavna. Viša efikasnost po megavatu smanjuje troškove energije i skraćuje vreme trajanja za obuku modela sa više triliona parametara. NVLink tkanina smanjuje preopterećenje međusobne sinhronizacije GPU-a, što smanjuje vreme obuke po satu za rad na modelima koji su usko povezani. Ako ste u oblaku, to se prevodi u veću propusnost po slobodnom prostoru u data centru.
Za preduzeća i laboratore, kompromisi kompliciraju odluke o akviziciji. Hardver zahteva prilagođenu distribuciju energije, 50-voltne DC šine ili više 33 kW napajanja, ohlađenu vodu ili zatvorene CDU-ove, i osoblje sa iskustvom u servisiranju tečno hlađenih ormara. Oni omogućavaju performanse, ali dodaju fiksne nadogradnje objekata koje je teško amortizovati pod malim ili iznenadnim korišćenjem.
Jedan očigledan protuvargument je diversifikacija dobavljača. Alternativni akceleratori i sistemi poput mašina napravljenih za specifične svrhe ili Cerebras klasa uređaja imaju različite tačke integracije i mogu izbeći zavisnost od NVLink-a. Veliki provajderi oblaka već mešaju tipove akceleratora u proizvodnji, što smanjuje rizik od zavisnosti od jednog dobavljača. Pogledajte istorijski primer velikih cloud implementacija alternativnih akceleratora za kontekst Amazon primenjuje Cerebras tehnologiju 25 puta brže nego.
Vodič odluka i uočene lekcije
Ako vam je potrebna održiva, predvidljiva kapacitet za veliku obuku i upravljate stotinama ormara, put NVL72 će obično smanjiti vreme rada i troškove energije po parametru. Ako su vaše potrebe povremene ili ograničene na desetine ormara, prvo iznajmite. Provajderi kolokacije će ponuditi srednje tačke, ali očekujte premijum cene za dovoljnu snagu i kapacitet CDU-a.
Primećujemo tri stalna obrazaca tokom proučavanja NVL sistema na nivou ormara. Prvo, dizajn snage postaje projekat, a ne ormar. Drugo, softverski alati koji koriste NVLink na nivou ormara su ključni faktor za stvarne dobitke u propusnosti. Treće, brzina instalacije i održavanja je važna jer jedan neispravni ormar može zaustaviti posao sa više ormara.
NVIDIA-ine NVL72 menja centar gravitacije za infrastrukturu obuke. Favorizuje organizacije koje mogu ulagati u kampus ili hiperskalnu snagu i hlađenje i koje planiraju softver kako bi koristili uske veze svim ka svemu. Za sve ostale, razuman put je postepena adaptacija: oblak ili kolokacija za inicijalnu skalu i ciljana obaveza na licu mesta tek kada iskorišćenje ostane visoko i predvidljivo.




