Vera Rubin NVL72: O que a infraestrutura de treinamento de próxima geração significa

Blog

Por Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 é a resposta da NVIDIA aos limites das GPUs em escala de servidor: uma máquina projetada, em escala de rack, que oculta a complexidade dos cabos, acomoda 72 GPUs Rubin e 36 CPUs Vera em um único chassi resfriado a líquido e move a largura de banda dentro do rack, permitindo que modelos maiores operem mais rápido por watt. Esse design muda a aritmética da economia de treinamento, forçando uma escolha mais nítida entre nuvem, colocalização e compra de hardware próprio.

Inovações de hardware e rede do Vera Rubin NVL72

As páginas de produtos e a documentação de arquitetura de referência da NVIDIA enumeram as mudanças concretas. Um rack GB300 NVL72 contém 72 GPUs Rubin e 36 CPUs Grace/Vera, uma rede NVLink classificada em cerca de 260 terabytes por segundo em todo o rack, o que resulta em cerca de 3,6 terabytes por segundo de largura de banda total por GPU, e bandejas de switch NVLink hot-swappable que eliminam longos cabos externos. A NVIDIA afirma que oferece até 10 vezes mais tokens por megawatt em comparação com a geração anterior GB200. O rack é totalmente resfriado a líquido e os números comuns de potência variam entre 120 a 155 quilowatts, dependendo da configuração e da carga de trabalho, portanto, a potência e o resfriamento da instalação são restrições de primeira ordem. Fontes: páginas de produtos e desenvolvedores da NVIDIA NVL72, documentação GB300 da HPE e Lenovo.

Compromissos práticos para compradores

Se você opera em escala de hyperscaler, a matemática é simples. Maior eficiência por megawatt reduz os gastos com energia e diminui o tempo de espera para execuções de treinamento com múltiplos trilhões de parâmetros. A rede NVLink reduz a sobrecarga de sincronização entre GPUs, o que diminui o tempo em reloj para o trabalho de modelo paralelo fortemente acoplado. Se você é uma nuvem, isso se traduz em mais throughput por baia de data center.

Para empresas e laboratórios, os compromissos complicam as decisões de aquisição. O hardware exige uma distribuição de energia sob medida, barramentos DC de 50 volts ou múltiplas prateleiras de potencia de 33 kW, água refrigerada ou CDUs em ciclo fechado, e funcionários experientes em serviço de rack resfriado a líquido. Esses elementos possibilitam desempenho, mas adicionam melhorias fixas nas instalações que são difíceis de amortizar sob uso pequeno ou intermitente.

Um contraargumento óbvio é a diversificação de fornecedores. Aceleradores e sistemas alternativos, como wafers projetados ou aparelhos da classe Cerebras, têm pontos de integração diferentes e podem evitar a dependência do NVLink. Grandes provedores de nuvem já misturaram tipos de aceleradores em produção, o que reduz o risco de um único fornecedor. Veja o exemplo histórico de grandes implementações em nuvem de aceleradores alternativos para contexto Amazon deploys Cerebras technology 25 times faster than.

Guia de decisão e lições observadas

Se você precisa de capacidade de treinamento em grande escala, sustentada e previsível, e opera centenas de racks, o caminho NVL72 geralmente reduzirá o tempo de execução e o custo de energia por parâmetro. Se suas necessidades são intermitentes ou limitadas a dezenas de racks, alugue primeiro. Provedores de colocalização oferecerão pontos intermediários, mas espere preços premium para potência e capacidade de CDU suficientes.

Observamos três padrões operacionais recorrentes ao estudar sistemas NVL em escala de rack. Primeiro, o design de potência se torna o projeto, não o rack. Em segundo lugar, ferramentas de software que exploram o NVLink em nível de rack são o fator limitante para ganhos reais de throughput. Terceiro, a velocidade de instalação e manutenção importa, pois uma única bandeja com falha pode parar um trabalho em múltiplos racks.

A NVL72 da NVIDIA muda o centro de gravidade para a infraestrutura de treinamento. Favorece organizações que podem investir em potência e resfriamento em campus ou hyperscale e que planejam software para usar conexões totais. Para todos os outros, o caminho sensato é a adoção gradual: nuvem ou colocalização para escala inicial e um compromisso on-premises direcionado apenas uma vez que a utilização permaneça alta e previsível.

Modelos virais

Explore nossos modelos virais com IA e aplique-os às suas fotos.

Explorar modelos