Vera Rubin NVL72: Co oznacza infrastruktura szkoleniowa nowej generacji

Blog

Autor: Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 to odpowiedź NVIDIA na ograniczenia GPU w skali serwera: maszyna zaprojektowana z myślą o rackach, która ukrywa złożoność okablowania, umieszcza 72 GPU Rubin i 36 CPU Vera w jednym chłodzonym cieczą chassis i przenosi pasmo wewnątrz racka, dzięki czemu większe modele działają szybciej na wat. Ten projekt zmienia arytmetykę ekonomii szkoleniowej, wymuszając ostrzejszy wybór między chmurą, kolokacją a zakupem własnego sprzętu.

Innowacje sprzętowe i sieciowe Vera Rubin NVL72

Strony produktów i dokumentacja architektury referencyjnej NVIDIA szczegółowo opisują konkretne zmiany. Rack GB300 NVL72 zawiera 72 GPU Rubin i 36 CPU Grace/Vera, tkaninę NVLink o przepustowości około 260 terabajtów na sekundę w całym racku, co daje około 3,6 terabajta na sekundę pasma all-to-all na GPU, oraz wymienne tray'e przełączników NVLink, które eliminują długie zewnętrzne kable. NVIDIA twierdzi, że oferuje do 10 razy więcej tokenów na megawat w porównaniu z poprzednią generacją GB200. Rack jest w pełni chłodzony cieczą, a powszechnie cytowane wartości mocy wahają się w zakresie 120 do 155 kilowatów w zależności od konfiguracji i obciążenia, więc zasilanie obiektu i chłodzenie są kluczowymi ograniczeniami. Źródła: Strony produktów i dla deweloperów NVIDIA NVL72, dokumentacja HPE i Lenovo GB300.

Praktyczne kompromisy dla nabywców

Jeśli działasz na skali hyperskalera, matematyka jest prosta. Wyższa efektywność na megawat redukuje wydatki na energię i skraca czas oczekiwania na szkolenia parametrów wielkości multi-bilionów. Tkanina NVLink redukuje narzuty synchronizacji między GPU, co skraca czas zegara dla ściśle powiązanej pracy równoległej modeli. Jeśli jesteś chmurą, przełoży się to na większą przepustowość na bay centrum danych.

Dla przedsiębiorstw i laboratoriów kompromisy komplikują decyzje o nabyciu. Sprzęt wymaga dostosowanej dystrybucji zasilania, szyn prądu stałego 50 woltów lub wielu zespołów zasilających 33 kW, chłodzonej wody lub zamkniętych pętli CDU oraz personelu doświadczonego w obsłudze racków chłodzonych cieczą. Te wymagania umożliwiają osiąganie wydajności, ale dodają stałe koszty związane z ulepszeniami obiektów, które są trudne do zamortyzowania przy małym lub sporadycznym użytkowaniu.

Jednym z oczywistych kontrargumentów jest dywersyfikacja dostawców. Alternatywne akceleratory i systemy, takie jak zamówione wafry lub urządzenia klasy Cerebras, mają różne punkty integracji i mogą uniknąć zależności od NVLink. Duzi dostawcy chmury już mieszają typy akceleratorów w produkcji, co zmniejsza ryzyko związane z pojedynczym dostawcą. Zobacz historyczny przykład dużych wdrożeń chmury alternatywnych akceleratorów dla kontekstu Amazon wdraża technologię Cerebras 25 razy szybciej niż.

Przewodnik decyzyjny i obserwowane lekcje

Jeśli potrzebujesz stałej, przewidywalnej pojemności szkoleniowej w dużej skali i posiadasz setki racków, ścieżka NVL72 zazwyczaj obniży czas działania i koszty energii na parametr. Jeśli twoje potrzeby są sporadyczne lub ograniczone do dziesiątek racków, najpierw wynajmij. Dostawcy kolokacji zaoferują rozwiązania pośrednie, ale oczekuj cen premium za wystarczającą moc i pojemność CDU.

Podczas badania systemów NVL w skali racka zaobserwowaliśmy trzy pojawiające się wzorce operacyjne. Po pierwsze, projekt zasilania staje się projektem, a nie rackiem. Po drugie, narzędzia programowe, które wykorzystują NVLink na poziomie racka, są czynnikiem decydującym o rzeczywistych zyskach wydajności. Po trzecie, szybkość instalacji i serwisowania ma znaczenie, ponieważ pojedyncza awaria tray'a może zatrzymać zadanie na wiele racków.

NVL72 firmy NVIDIA zmienia centrum ciężkości dla infrastruktury szkoleniowej. Sprzyja organizacjom, które mogą inwestować w zasilanie i chłodzenie kampusowe lub hyperskalowe i które planują oprogramowanie wykorzystujące ściśle powiązane linki all-to-all. Dla wszystkich innych rozsądna ścieżka to stopniowa adopcja: chmura lub kolokacja na początkową skalę i ukierunkowane zobowiązanie lokalne dopiero po osiągnięciu wysokiego i przewidywalnego poziomu wykorzystania.

Wirusowe szablony

Odkryj nasze wirusowe szablony AI i zastosuj je do swoich zdjęć.

Odkryj szablony