Vera Rubin NVL72: Какво означава инфраструктурата за обучение след следващото поколение

Blog

От Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 е отговорът на NVIDIA на ограниченията на графичните процесори в сървърни мащаби: машина, създадена с конкретна цел, на шаси, която скрива сложността на кабелите, вгражда 72 Rubin GPUs и 36 Vera CPUs в един единствен корпус с течностно охлаждане и пренася пропускната способност в рамките на шкафа, така че по-големите модели да работят по-бързо на ват. Този дизайн променя аритметиката на икономиката на обучението, като налага по-рязък избор между облаци, колокация и покупка на собствено оборудване.

Иновации в хардуера и мрежата на Vera Rubin NVL72

Продуктовите страници на NVIDIA и документацията за референтната архитектура описват конкретните промени. Шкафът GB300 NVL72 съдържа 72 Rubin GPUs и 36 Grace/Vera CPUs, NVLink мрежа с рейтинг от около 260 терабайта в секунда през шкафа, което означава около 3.6 терабайта в секунда всякъде помежду GPU, и подмяна на NVLink ключови стелажи, които премахват дългите външни кабели. NVIDIA твърди, че получавате до 10 пъти повече токени на мегават в сравнение с предишното поколение GB200. Шкафът е напълно течностно охлаждан и обикновените фигурите на мощността са в диапазона от 120 до 155 киловата в зависимост от конфигурацията и работното натоварване, така че захранването и охлаждането на обекта са ограничения от първи ред. Източници: продуктовите и разработчически страници на NVIDIA NVL72, HPE и Lenovo GB300 документация.

Практически търговски компромиси за купувачите

Ако оперирате в хипермащаб, математиката е проста. По-високата ефективност на мегават намалява разходите за енергия и времето за изпълнение на тренировки с параметри в триллиони. NVLink мрежата намалява разходите за синхронизация между GPU, което намалява времето за изпълнение на строго свързана паралелна работа. Ако сте облак, това означава по-висока производителност на всяка стеница в центъра за данни.

За предприятия и лаборатории търговските компромиси усложняват решенията за придобиване. Хардуерът изисква индивидуално разпределение на електрическата енергия, 50 волт DC шини или множество 33 kW електрически стелажи, охладена вода или затворени CDUs, и персонал с опит в обслужването на течностно охлаждане. Те позволяват производителност, но добавят фиксирани удължения на съоръженията, които е трудно да се амортизират при малка или прекъсваща употреба.

Очевиден контрааргумент е диверсификацията на доставчика. Алтернативни ускорители и системи, като целенасочени вейфери или уреди клас Cerebras, имат различни точки на интеграция и могат да избегнат зависимостта от NVLink. Големите облачни доставчици вече комбинират типове ускорители в продукция, което намалява риска от зависимост от един доставчик. Вижте историческия пример с големи облачни внедрявания на алтернативни ускорители за контекст Amazon внедрява Cerebras технология 25 пъти по-бързо от.

Ръководство за решения и наблюдавани уроци

Ако имате нужда от устойчиво, предсказуемо мащабно капацитет за обучение и управлявате стотици шкафове, пътят NVL72 обикновено ще намали времето за работа и разходите за енергия на параметър. Ако нуждите ви са прекъсващи или ограничени до десетки шкафа, наемайте първо. Доставчиците на услуги за колокация ще предложат средни решения, но очаквайте високи цени за достатъчна мощност и капацитет на CDU.

Наблюдавахме три повтарящи се оперативни модела, докато проучвахме системи с NVL на шкафово ниво. Първо, проектирането на електрическата енергия става проект, а не шкаф. Второ, софтуерните инструменти, които експлоатират NVLink на ниво шкаф, са ограничителният фактор за реални увеличения на производителността. Трето, скоростта на инсталиране и обслужване е важна, тъй като един единствен провален стак може да спре работа на много шкафове.

NVL72 на NVIDIA променя централната точка на тежест за инфраструктурата за обучение. Тя предпочита организации, които могат да инвестират в мощност и охлаждане на кампус или хипермащаб и планират софтуер за използване на плътно свързани връзки. За всички останали разумният път е етапна адаптация: облак или колокация за начално скалиране и целенасочена ангажираност на място, само когато използването остане високо и предсказуемо.

Вирусни шаблони

Разгледай нашите вирусни AI шаблони и ги приложи към своите снимки.

Разгледай шаблоните