Vera Rubin NVL72: Що означає інфраструктура навчання наступного покоління

Blog

Автор: Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 є відповіддю NVIDIA на обмеження серверних GPU: це спеціально побудована машина в одиничному стійці, яка приховує складність кабелів, містить 72 GPU Rubin і 36 CPU Vera у одному рідинно-охолодженому шасі, та переміщує пропускну здатність всередині стійки, щоб більші моделі працювали швидше на ват. Такий дизайн змінює арифметику економіки навчання, змушуючи чіткіше вибирати між хмарними рішеннями, колокацією та покупкою власного обладнання.

Інновації в апаратному забезпеченні та мережі Vera Rubin NVL72

Сторінки продукту NVIDIA та документація архітектури визначають конкретні зміни. Стійка GB300 NVL72 містить 72 GPU Rubin та 36 CPU Grace/Vera, NVLink, що забезпечує близько 260 терабайтів на секунду по всій стійці, що складає близько 3.6 терабайт на секунду на кожен GPU, та гарячозамінні NVLink перемикачі, які усувають довгі зовнішні кабелі. NVIDIA стверджує, що продуктивність зросла до 10 разів більше токенів на мегават у порівнянні з попереднім поколінням GB200. Стійка повністю рідинно охолоджена, і зазвичай наведені показники споживаної потужності варіюються в межах 120 до 155 кіловат залежно від конфігурації та навантаження, тому енергія та охолодження приміщення є обмеженнями першого порядку. Джерела: сторінки продукту та розробника NVIDIA NVL72, документація HPE та Lenovo GB300.

Практичні компроміси для покупців

Якщо ви працюєте на рівні гіпермасштабування, математика проста. Вища ефективність на мегават зменшує витрати на енергію та скорочує час у стіні для навчального процесу з багато-трильйонними параметрами. NVLink знижує накладні витрати на синхронізацію між GPU, що скорочує час у стіні навчання для тісно пов’язаних паралельних моделей. Якщо ви, хмара, це означає більше пропускної здатності на кожен відсік дата-центру.

Для підприємств та лабораторій компроміси ускладнюють рішення про придбання. Апаратне забезпечення вимагає спеціалізованого розподілу потужності, 50-вольтних DC розподільних панелей або кількох 33 кВт електричних шаф, охолодженої води або закритих рідинних охолоджувачів, і персоналу, який має досвід обслуговування рідинно-охолоджених стійок. Вони забезпечують продуктивність, але додають фіксовані вдосконалення приміщення, які важко амортизувати при малих або спорадичних використаннях.

Один очевидний контраргумент, різноманітність постачальників. Альтернативні прискорювачі та системи, такі як спеціально розроблені кремнієві пластини або пристрої класу Cerebras, мають інші точки інтеграції та можуть уникати залежності від NVLink. Великі постачальники хмарних послуг вже змішували типи прискорювачів в експлуатації, що знижує ризик від єдиного постачальника. Дивіться історичний приклад великих хмарних розгортань альтернативних прискорювачів для контексту Amazon розгортає технології Cerebras в 25 разів швидше, ніж.

Посібник з рішень та спостережені уроки

Якщо вам потрібна стабільна, передбачувана потужність навчання великомасштабного характеру та ви експлуатуєте сотні стійок, шлях NVL72 зазвичай знижує час виконання та витрати на енергію на параметр. Якщо ваші потреби непостійні або обмежені десятками стійок, спочатку орендуйте. Постачальники колокацій пропонують проміжки, але очікуйте преміальні ціни на достатню потужність та ємність охолоджувачів.

Ми спостерігали три повторювані операційні моделі, вивчаючи системи NVL на стійках. По-перше, проект стає проектом електропостачання, а не стійкою. По-друге, програмне забезпечення, яке використовує NVLink на рівні стійки, є визначальним фактором для справжніх приростів пропускної здатності. По-третє, швидкість установки та обслуговування має значення, оскільки одна несправна стійка може зупинити роботу множинного завдання на стійках.

NVL72 від NVIDIA змінює центр ваги для інфраструктури навчання. Він віддає перевагу організаціям, які можуть інвестувати в потужність та охолодження на території або гіпермасштабування, а також планувати програмне забезпечення для використання тісних зв’язків. Для всіх інших розумний шлях, поетапне впровадження: хмара або колокація для початкового масштабу та цільове зобов'язання на місці лише після того, як використання залишається високим і передбачуваним.

Вірусні шаблони

Досліджуй наші вірусні AI-шаблони та застосовуй їх до своїх фото.

Переглянути шаблони