Vera Rubin NVL72: Что означает инфраструктура следующего поколения для обучения
Автор: Win.AI Editorial

Vera Rubin NVL72, ответ NVIDIA на ограничения графических процессоров на уровне серверов: специально созданная машина масштаба стойки, которая скрывает сложность подключения кабелей, включает 72 графических процессора Rubin и 36 процессоров Vera в одном корпусе с жидкостным охлаждением и перемещает пропускную способность внутри стойки, чтобы более крупные модели работали быстрее за ватт. Этот дизайн изменяет арифметику экономии на обучении, заставляя выбрать между облаком, совместным размещением и покупкой собственного оборудования.
Аппаратные и сетевые инновации Vera Rubin NVL72
На страницах продуктов и в документации по эталонной архитектуре NVIDIA перечислены конкретные изменения. Стойка GB300 NVL72 содержит 72 графических процессора Rubin и 36 процессоров Grace/Vera, сеть NVLink с пропускной способностью около 260 терабайт в секунду по стойке, что составляет примерно 3.6 терабайт в секунду общей пропускной способности на каждый графический процессор, и модули переключателей NVLink с горячей заменой, которые устраняют длинные внешние кабели. NVIDIA утверждает, что она обеспечивает до 10 раз больше токенов на мегаватт по сравнению с предыдущим поколением GB200. Стойка полностью охлаждается жидкостью, а распространенные показатели мощности варьируются от 120 до 155 киловатт в зависимости от конфигурации и рабочей нагрузки, поэтому мощность и охлаждение на объектах являются первоочередными ограничениями. Источники: страницы продукта и разработчиков NVIDIA NVL72, документация HPE и Lenovo GB300.
Практические компромиссы для покупателей
Если вы работаете на масштабе гипермасштабной инфраструктуры, математика проста. Более высокая эффективность на мегаватт снижает затраты на энергию и уменьшает время в стенде для многотриллионных обучающих запусков. Сеть NVLink снижает накладные расходы на синхронизацию между графическими процессорами, что уменьшает реальное время обучения для плотно связанных параллельных моделей. Если вы облачный провайдер, это переводится в больший проходной объем на один отсек в дата-центре.
Для предприятий и лабораторий компромиссы усложняют решения по приобретению. Оборудование требует индивидуального распределения электроэнергии, 50-вольтные постоянные шинопроводы или несколько комплектов питания по 33 кВт, охладителей или закрытых блоков CDUs, а также персонал с опытом обслуживания стойки с жидкостным охлаждением. Эти требования обеспечивают производительность, но добавляют фиксированные обновления на объекте, которые трудно амортизировать при небольшом или переменном использовании.
Очевидным контраргументом является диверсификация поставщиков. Альтернативные ускорители и системы, такие как специально созданные полупроводниковые пластинки или устройства класса Cerebras, имеют разные точки интеграции и могут избегать зависимости от NVLink. Крупные облачные провайдеры уже смешивают типы ускорителей в производстве, что снижает риск работы с одним поставщиком. Смотрите исторический пример крупных облачных развертываний альтернативных ускорителей для контекста Amazon развертывает технологии Cerebras в 25 раз быстрее чем.
Руководство по принятию решений и наблюдаемые уроки
Если вам нужна стабильная, предсказуемая возможность увеличения масштабов обучения, и вы используете сотни стоек, путь NVL72 обычно снизит время выполнения и энергозатраты на параметр. Если ваши потребности являются переменными или ограничены десятками стоек, сначала арендуйте. Провайдеры совместного размещения предложат промежуточные решения, но ожидайте высокую цену за достаточную мощность и вместимость CDU.
Мы обнаружили три повторяющиеся operational patterns при изучении систем NVL на уровне стоек. Во-первых, проектом становится не стойка, а дизайн питания. Во-вторых, программные инструменты, которые используют NVLink на уровне стойки, являются ограничивающим фактором для реальных приростов пропускной способности. В-третьих, скорость установки и обслуживания важна, так как одна неудавшаяся модуль может остановить многостеночную задачу.
NVL72 от NVIDIA изменяет центр тяжести инфраструктуры для обучения. Он предпочтителен для организаций, способных инвестировать в мощность и охлаждение кампуса или гипермасштабного уровня и планирующих программу для использования плотных связей. Для всех остальных разумным путем будет поэтапное внедрение: облако или совместное размещение для начального масштаба и целенаправленное локальное обязательство только после того, как использование станет высоким и предсказуемым.




