Vera Rubin NVL72: Lo que significa la infraestructura de entrenamiento de próxima generación

Blog

Por Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 es la respuesta de NVIDIA a los límites de las GPU de escala de servidor: una máquina diseñada a medida, de escala de rack, que oculta la complejidad de los cables, incorpora 72 GPU Rubin y 36 CPU Vera en un solo chasis enfriado por líquido, y traslada el ancho de banda dentro del rack para que los modelos más grandes se ejecuten más rápido por vatio. Ese diseño cambia la aritmética de la economía de entrenamiento, mientras obliga a una elección más clara entre la nube, la colocalización y la compra de tu propio hardware.

Innovaciones en hardware y red del Vera Rubin NVL72

Las páginas de productos y la documentación de arquitectura de referencia de NVIDIA enumeran los cambios concretos. Un rack GB300 NVL72 contiene 72 GPU Rubin y 36 CPU Grace/Vera, una estructura NVLink valorada en aproximadamente 260 terabytes por segundo a través del rack, lo que equivale a alrededor de 3.6 terabytes por segundo de ancho de banda total entre GPUs, y bandejas de conmutadores NVLink intercambiables en caliente que eliminan largos cables externos. NVIDIA afirma que ofrece hasta 10 veces más tokens por megavatio en comparación con la generación anterior GB200. El rack es completamente enfriado por líquido y las cifras de potencia comúnmente citadas oscilan entre 120 y 155 kilovatios, dependiendo de la configuración y la carga de trabajo, por lo que la potencia y la refrigeración de la instalación son restricciones de primer orden. Fuentes: páginas de productos y desarrolladores de NVIDIA NVL72, documentación de HPE y Lenovo GB300.

Compensaciones prácticas para compradores

Si operas a escala de hyperscaler, las matemáticas son simples. Una mayor eficiencia por megavatio reduce el gasto energético y disminuye el tiempo de espera para ejecuciones de entrenamiento de múltiples billones de parámetros. La estructura NVLink reduce la sobrecarga de sincronización entre GPUs, lo que disminuye el tiempo en reloj de pared para trabajos de paralelismo de modelo estrechamente acoplados. Si eres una nube, eso se traduce en más rendimiento por espacio en el centro de datos.

Para empresas y laboratorios, las compensaciones complican las decisiones de adquisición. El hardware exige una distribución de energía a medida, barras colectoras de CC de 50 voltios o múltiples estantes de energía de 33 kW, agua refrigerada o CDUs de circuito cerrado, y personal con experiencia en el servicio de racks enfriados por líquido. Eso habilita el rendimiento, pero añade mejoras fijas a las instalaciones que son difíciles de amortizar bajo un uso pequeño o intermitente.

Un argumento en contra obvio es la diversificación de proveedores. Aceleradores y sistemas alternativos, como obleas diseñadas a medida o dispositivos de clase Cerebras, tienen diferentes puntos de integración y pueden evitar la dependencia de NVLink. Los grandes proveedores de nube ya han mezclado tipos de aceleradores en producción, lo que reduce el riesgo de un único proveedor. Ver el ejemplo histórico de grandes implementaciones en la nube de aceleradores alternativos para más contexto Amazon despliega tecnología Cerebras 25 veces más rápido que.

Guía de decisiones y lecciones observadas

Si necesitas capacidad de entrenamiento a gran escala sostenida y predecible y operas cientos de racks, el camino NVL72 generalmente reducirá el tiempo de ejecución y el costo energético por parámetro. Si tus necesidades son intermitentes o están restringidas a docenas de racks, alquila primero. Los proveedores de colocalización ofrecerán puntos intermedios, pero espera precios premium por una capacidad de energía y CDU suficiente.

Observamos tres patrones operativos recurrentes al estudiar sistemas NVL a escala de rack. Primero, el diseño de energía se convierte en el proyecto, no el rack. Segundo, las herramientas de software que explotan NVLink a nivel de rack son el factor limitante para ganancias reales de rendimiento. Tercero, la velocidad de instalación y servicio es importante porque una bandeja fallida puede detener un trabajo de múltiples racks.

El NVL72 de NVIDIA cambia el centro de gravedad para la infraestructura de entrenamiento. Favorece a organizaciones que pueden invertir en energía y refrigeración a nivel de campus o hyperscale y que planean software para utilizar enlaces estrechos entre todos. Para todos los demás, el camino sensato es la adopción por etapas: nube o colocalización para la escala inicial y un compromiso de on-premise dirigido solo una vez que la utilización se mantenga alta y predecible.

Plantillas virales

Explora nuestras plantillas virales con IA y aplícalas a tus fotos.

Explorar plantillas