Vera Rubin NVL72: Šta znači infra za obuku naredne generacije

Blog

Аутор: Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 je NVIDIA-ino rešenje za ograničenja GPU-ova na nivou servera: mašina napravljena za svrhu, na nivou ormara, koja skriva složenost kablova, sadrži 72 Rubin GPU-a i 36 Vera CPU-a u jednoj tečno hlađenoj šasiji, i premesta propusnost unutar ormara tako da veći modeli brže rade po vatu. Ovaj dizajn menja aritmetiku ekonomike obuke, dok prisiljava oštriji izbor između oblaka, kolokacije i kupovine vlastitog hardvera.

Inovacije u hardveru i mreži Vera Rubin NVL72

NVIDIA-ine stranice proizvoda i dokumentacija o referentnoj arhitekturi navode konkretne promene. GB300 NVL72 ormar sadrži 72 Rubin GPU-a i 36 Grace/Vera CPU-a, NVLink tkanina ocenjena na približno 260 terabajta po sekundi kroz ormar što iznosi oko 3,6 terabajta po sekundi propusnosti za svaki GPU, i vruće zamjenjive NVLink prekidače koji uklanjaju duge spoljne kablove. NVIDIA tvrdi da omogućava do 10 puta više tokena po megavatu u poređenju sa prethodnom generacijom GB200. Ormar je potpuno tečno hlađen, a uobičajene brojke o potrošnji struje kreću se u rasponu od 120 do 155 kilovata, u zavisnosti od konfiguracije i opterećenja, pa su snaga objekta i hlađenje ograničenja prvog reda. Izvori: NVIDIA NVL72 produktne i developerske stranice, HPE i Lenovo GB300 dokumentacija.

Praktične kompromise za kupce

Ako radite na skali hiperskalera, matematika je jednostavna. Viša efikasnost po megavatu smanjuje troškove energije i skraćuje vreme trajanja za obuku modela sa više triliona parametara. NVLink tkanina smanjuje preopterećenje međusobne sinhronizacije GPU-a, što smanjuje vreme obuke po satu za rad na modelima koji su usko povezani. Ako ste u oblaku, to se prevodi u veću propusnost po slobodnom prostoru u data centru.

Za preduzeća i laboratore, kompromisi kompliciraju odluke o akviziciji. Hardver zahteva prilagođenu distribuciju energije, 50-voltne DC šine ili više 33 kW napajanja, ohlađenu vodu ili zatvorene CDU-ove, i osoblje sa iskustvom u servisiranju tečno hlađenih ormara. Oni omogućavaju performanse, ali dodaju fiksne nadogradnje objekata koje je teško amortizovati pod malim ili iznenadnim korišćenjem.

Jedan očigledan protuvargument je diversifikacija dobavljača. Alternativni akceleratori i sistemi poput mašina napravljenih za specifične svrhe ili Cerebras klasa uređaja imaju različite tačke integracije i mogu izbeći zavisnost od NVLink-a. Veliki provajderi oblaka već mešaju tipove akceleratora u proizvodnji, što smanjuje rizik od zavisnosti od jednog dobavljača. Pogledajte istorijski primer velikih cloud implementacija alternativnih akceleratora za kontekst Amazon primenjuje Cerebras tehnologiju 25 puta brže nego.

Vodič odluka i uočene lekcije

Ako vam je potrebna održiva, predvidljiva kapacitet za veliku obuku i upravljate stotinama ormara, put NVL72 će obično smanjiti vreme rada i troškove energije po parametru. Ako su vaše potrebe povremene ili ograničene na desetine ormara, prvo iznajmite. Provajderi kolokacije će ponuditi srednje tačke, ali očekujte premijum cene za dovoljnu snagu i kapacitet CDU-a.

Primećujemo tri stalna obrazaca tokom proučavanja NVL sistema na nivou ormara. Prvo, dizajn snage postaje projekat, a ne ormar. Drugo, softverski alati koji koriste NVLink na nivou ormara su ključni faktor za stvarne dobitke u propusnosti. Treće, brzina instalacije i održavanja je važna jer jedan neispravni ormar može zaustaviti posao sa više ormara.

NVIDIA-ine NVL72 menja centar gravitacije za infrastrukturu obuke. Favorizuje organizacije koje mogu ulagati u kampus ili hiperskalnu snagu i hlađenje i koje planiraju softver kako bi koristili uske veze svim ka svemu. Za sve ostale, razuman put je postepena adaptacija: oblak ili kolokacija za inicijalnu skalu i ciljana obaveza na licu mesta tek kada iskorišćenje ostane visoko i predvidljivo.

Вирусни шаблони

Истражи наше вирусне AI шаблоне и примени их на своје фотографије.

Истражи шаблоне