Vera Rubin NVL72: Mit jelent a következő generációs képzési infrastruktúra?

Blog

Szerző: Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

A Vera Rubin NVL72 az NVIDIA válasza a szerver méretű GPU-k határaira: egy célzottan épített, rack méretű gép, amely elrejti a kábelkomplexitást, 72 Rubin GPU-t és 36 Vera CPU-t pakol egyetlen folyadékhűtéses házba, és a sávszélességet a rack belsejébe irányítja, így a nagyobb modellek gyorsabban futnak wattonként. Ez a dizájn megváltoztatja a képzési gazdaságosság matematikáját, miközben éles választás elé állítja a felhasználókat a felhő, a központi elhelyezés és a saját hardver vásárlása között.

Vera Rubin NVL72 hardver- és hálózati újítások

Az NVIDIA termékoldalai és referenciak 구성 문서는 a konkrét változásokat sorolják fel. Egy GB300 NVL72 rack 72 Rubin GPU-t és 36 Grace/Vera CPU-t tartalmaz, egy NVLink szövetet, amely körülbelül 260 terabájt/s sebességgel működik a rackben, ami körülbelül 3,6 terabájt/s összes-összefüggő sávszélességet jelent GPU-nként, és forró-swappable NVLink kapcsolószekrényeket, amelyek eltávolítják a hosszú külső kábeleket. Az NVIDIA akár 10-szer több tokent ígér megawattonként a korábbi GB200 generációhoz képest. A rack teljesen folyadékhűtött, és a közölt teljesítményadatok az 120-tól 155 kilowattig terjednek a konfigurációtól és terheléstől függően, így a létesítmény áramellátása és hűtése elsődleges korlátokat jelent. Források: NVIDIA NVL72 termék- és fejlesztői oldalak, HPE és Lenovo GB300 dokumentáció.

Gyakorlati kereskedelmi lehetőségek vásárlóknak

Ha hiperskálát üzemeltetsz, a számok egyszerűek. A megawatt per hatékonyság növelése csökkenti az energiadíjat és csökkenti a falidőt a több trillió paraméteres képzési futásokhoz. Az NVLink szövet csökkenti az inter-GPU szinkronizációs túlterhelést, ami csökkenti a képzési óra időt a szorosan összekapcsolt modellek párhuzamos munkájához. Ha felhő vagy, akkor ez több áteresztőképességet jelent adatközpont bay-enként.

A vállalatok és laborok számára a kereskedelmi lehetőségek bonyolítják a beszerzési döntéseket. A hardver speciális áramellátást igényel, 50 volt DC buszcsöveket vagy több 33 kW-os tápegységet, hűtött víz vagy zárt hurkú CDU-kat, valamint tapasztalt személyzetet a folyadékhűtéses rack-szervizhez. Ezek lehetővé teszik a teljesítményt, de olyan fix létesítményi fejlesztéseket adnak hozzá, amelyeket nehéz amortizálni kis vagy hullámzó használat mellett.

Egy nyilvánvaló ellenérv a beszállítói diverzifikáció. Alternatív gyorsítók és rendszerek, mint például a célzottan épített lemezek vagy Cerebras-osztályú készülékek, különböző integrációs pontokkal rendelkeznek, és elkerülhetik az NVLink függőséget. A nagy felhőszolgáltatók már kevert gyorsítótípusokat alkalmaznak a gyártásban, ami csökkenti az egy beszállítóra vonatkozó kockázatot. Lásd a történelmi példát a nagy felhőalkalmazások alternatív gyorsítók implementálásáról a kontextus megértéséhez Amazon 25-ször gyorsabban telepíti a Cerebras technológiát.

Döntési útmutató és megfigyelt tanulságok

Ha folyamatos, kiszámítható nagy léptékű képzési kapacitásra van szükséged, és több száz racken üzemeltetsz, az NVL72 megoldás általában csökkenti a futási időt és az energia költséget paraméterenként. Ha az igényeid szakaszosak vagy korlátozódnak néhány rackre, először bérelj. A központosító szolgáltatók középúton kínálnak, de számíts prémium árakra elegendő energia- és CDU-kapacitás esetén.

Három ismétlődő működési mintát figyeltünk meg a rack alapú NVL rendszerek tanulmányozása során. Először is, az energiamérnöki tervezés válik a projektté, nem a rack. Másodszor, a rack szintű NVLink-et kihasználó szoftvereszközök állítják meg a valódi áteresztőképességet. Harmadszor, a telepítési és karbantartási sebesség fontos, mert egyetlen meghibásodott tray megállíthat egy több racket érintő munkát.

Az NVIDIA NVL72 megváltoztatja a képezési infrastruktúra súlypontját. Támogatja azokat a szervezeteket, amelyek tudnak invesztálni campus vagy hiperskálás áramellátásba és hűtésbe, és akik tervezik a szoftvert, hogy kihasználja a szoros összevont kapcsolatokat. Mindenki másnak az ésszerű út a fokozatos adaptáció: felhő vagy központosítás a kezdeti léptékhez, és egy célzott helyszíni elköteleződés csak akkor, amikor a kihasználás magas és kiszámítható.

Virális sablonok

Fedezd fel virális AI sablonjainkat, és alkalmazd őket a fotóidra.

Sablonok felfedezése