Vera Rubin NVL72: Apa yang Dimaksud dengan Infrastruktur Pelatihan Generasi Mendatang

Blog

Oleh Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 adalah jawaban NVIDIA atas batasan GPU skala server: mesin yang dirancang khusus, skala rak yang menyembunyikan kompleksitas kabel, mengemas 72 GPU Rubin dan 36 CPU Vera ke dalam satu chasis yang didinginkan dengan cairan, dan memindahkan bandwidth di dalam rak sehingga model yang lebih besar berjalan lebih cepat per watt. Desain itu mengubah aritmetika ekonomi pelatihan sambil memaksa pilihan yang lebih tajam antara cloud, kolokasi, dan membeli perangkat keras sendiri.

Inovasi perangkat keras dan jaringan Vera Rubin NVL72

Halaman produk dan dokumentasi arsitektur referensi NVIDIA menjabarkan perubahan konkret. Rak GB300 NVL72 mengandung 72 GPU Rubin dan 36 CPU Grace/Vera, sebuah kain NVLink yang dinilai sekitar 260 terabyte per detik di seluruh rak yang dihitung menjadi sekitar 3,6 terabyte per detik bandwidth all-to-all per GPU, dan baki sakelar NVLink yang dapat di-hot-swap yang menghapus kabel eksternal panjang. NVIDIA mengklaim hingga 10 kali lebih banyak token per megawatt dibandingkan dengan generasi GB200 sebelumnya. Rak sepenuhnya didinginkan dengan cairan dan angka daya yang biasa dikutip berada dalam kisaran 120 hingga 155 kilowatt tergantung pada konfigurasi dan beban kerja, jadi daya fasilitas dan pendinginan adalah batasan urutan pertama. Sumber: halaman produk dan pengembang NVIDIA NVL72, dokumentasi HPE dan Lenovo GB300.

Pertimbangan praktis bagi pembeli

Jika Anda beroperasi pada skala hyperscaler, perhitungannya sederhana. Efisiensi yang lebih tinggi per megawatt mengurangi pengeluaran energi dan mengurangi waktu yang dibutuhkan untuk pelatihan parameter multi-triliun. Kain NVLink mengurangi overhead sinkronisasi antar-GPU, yang menurunkan waktu jam dinding pelatihan untuk pekerjaan model paralel yang terkait erat. Jika Anda adalah cloud, itu berarti lebih banyak throughput per teluk pusat data.

Untuk perusahaan dan laboratorium, pertimbangan kompleks memperumit keputusan akuisisi. Perangkat keras ini membutuhkan distribusi daya yang disesuaikan, bus DC 50 volt atau beberapa rak daya 33 kW, air dingin atau CDU loop tertutup, dan staf yang berpengalaman dalam layanan rak yang didinginkan dengan cairan. Hal tersebut memungkinkan kinerja tetapi menambah peningkatan fasilitas tetap yang sulit untuk diamortisasi di bawah penggunaan kecil atau yang tiba-tiba.

Satu argumen tandingan yang jelas adalah diversifikasi vendor. Akselerator alternatif dan sistem seperti wafer yang dirancang khusus atau perangkat kelas Cerebras memiliki titik integrasi yang berbeda dan dapat menghindari ketergantungan NVLink. Penyedia cloud besar telah mencampur jenis akselerator di produksi, yang mengurangi risiko vendor tunggal. Lihat contoh sejarah penerapan cloud besar dari akselerator alternatif untuk konteks Amazon menerapkan teknologi Cerebras 25 kali lebih cepat daripada.

Panduan keputusan dan pelajaran yang diamati

Jika Anda membutuhkan kapasitas pelatihan besar-besaran yang berkelanjutan dan dapat diprediksi dan mengoperasikan ratusan rak, jalur NVL72 biasanya akan menurunkan waktu jalankan dan biaya energi per parameter. Jika kebutuhan Anda bersifat tidak teratur atau dibatasi pada puluhan rak, sewalah terlebih dahulu. Penyedia kolokasi akan menawarkan titik tengah tetapi harapkan harga premium untuk daya dan kapasitas CDU yang cukup.

Kami mengamati tiga pola operasional yang berulang saat mempelajari sistem NVL skala rak. Pertama, desain daya menjadi proyek, bukan rak. Kedua, alat perangkat lunak yang memanfaatkan NVLink skala rak adalah faktor penghalang untuk keuntungan throughput nyata. Ketiga, kecepatan instalasi dan layanan penting karena satu baki yang gagal dapat menghentikan pekerjaan multi-rak.

NVL72 NVIDIA mengubah pusat gravitasi untuk infrastruktur pelatihan. Ini lebih menguntungkan untuk organisasi yang dapat berinvestasi dalam daya dan pendinginan kampus atau hyperscale dan yang merencanakan perangkat lunak untuk menggunakan tautan all-to-all yang ketat. Untuk semua orang yang lain, jalur yang masuk akal adalah adopsi bertahap: cloud atau kolokasi untuk skala awal dan komitmen di tempat yang ditargetkan hanya setelah pemanfaatan tetap tinggi dan dapat diprediksi.

Template viral

Jelajahi template AI viral kami dan terapkan ke fotomu.

Jelajahi template
Biaya dan Trade-off Operasional Vera Rubin NVL72