Vera Rubin NVL72: Apa maksud infrastruktur latihan generasi akan datang
Oleh Win.AI Editorial

Vera Rubin NVL72 adalah jawapan NVIDIA kepada had GPU berskala pelayan: sebuah mesin berskala rak yang dibina khusus, menyembunyikan kompleksiti kabel, mengepalkan 72 GPU Rubin dan 36 CPU Vera ke dalam satu chasis penyejuk cecair, dan memindahkan lebar jalur di dalam rak supaya model yang lebih besar berjalan lebih pantas per watt. Reka bentuk itu mengubah aritmetik ekonomi latihan sambil memaksa pilihan lebih tajam antara awan, kolokasi dan membeli perkakasan anda sendiri.
Inovasi perkakasan dan rangkaian Vera Rubin NVL72
Halaman produk dan dokumentasi seni bina rujukan NVIDIA menyenaraikan perubahan konkrit. Rak GB300 NVL72 mengandungi 72 GPU Rubin dan 36 CPU Grace/Vera, fabric NVLink yang dinilai pada kira-kira 260 terabait per saat di seluruh rak, yang bersamaan dengan kira-kira 3.6 terabait per saat lebar jalur semua-ke-semua per GPU, dan dulang suis NVLink yang boleh ditukar panas yang menghapuskan kabel luar yang panjang. NVIDIA mendakwa sehingga 10 kali lebih banyak token per megawatt berbanding generasi GB200 sebelum ini. Rak ini sepenuhnya disejukkan dengan cecair dan angka kuasa yang sering dipetik adalah dalam julat 120 hingga 155 kilowatt bergantung kepada konfigurasi dan beban kerja, jadi kuasa dan penyejukan kemudahan adalah sekatan peringkat pertama. Sumber: Halaman produk dan pemaju NVL72 NVIDIA, dokumentasi HPE dan Lenovo GB300.
Perdagangan praktikal untuk pembeli
Jika anda beroperasi pada skala hyperscaler, matematiknya adalah mudah. Kecekapan yang lebih tinggi per megawatt mengurangkan perbelanjaan tenaga dan mengurangkan masa dinding untuk latihan model parameternya multi-trillion. Fabric NVLink mengurangkan overhead penyegerakan inter-GPU, yang mengurangkan masa jam dinding latihan untuk kerja model selari yang rapat. Jika anda adalah penyedia awan, itu bermaksud lebih banyak throughput per ruang data pusat.
Bagi perusahaan dan makmal, kompromi menimbulkan keputusan pengambilalihan yang lebih rumit. Perkakasan memerlukan pengedaran kuasa yang khas, bar bas DC 50 volt atau rak kuasa 33 kW berbilang, air sejuk atau CDU gelung tertutup, dan kakitangan yang berpengalaman dalam perkhidmatan rak yang disejukkan cecair. Itu membolehkan prestasi tetapi menambah peningkatan kemudahan tetap yang sukar untuk diambil balik di bawah penggunaan kecil atau bertumpu.
Satu hujah balas yang jelas adalah kepelbagaian vendor. Pecutan alternatif dan sistem seperti wafer yang dibina khusus atau alat kelas Cerebras mempunyai titik integrasi yang berbeza dan boleh mengelakkan kebergantungan NVLink. Penyedia awan besar telah pun mencampurkan jenis pecutan dalam pengeluaran, yang mengurangkan risiko vendor tunggal. Lihat contoh sejarah penyebaran pecutan alternatif yang besar untuk konteks Amazon menggunakan teknologi Cerebras 25 kali lebih pantas daripada.
Panduan keputusan dan pelajaran yang diperhatikan
Jika anda memerlukan kapasiti latihan berskala besar yang berterusan dan boleh diramalkan dan mengendalikan ratusan rak, laluan NVL72 biasanya akan mengurangkan masa larian dan kos tenaga per parameter. Jika keperluan anda bersifat sementara atau terhad kepada puluhan rak, sewa terlebih dahulu. Penyedia kolokasi akan menawarkan titik tengah tetapi harapkan harga premium untuk kuasa dan kapasiti CDU yang mencukupi.
Kami telah mengamati tiga pola operasi berulang semasa mengkaji sistem NVL berskala rak. Pertama, reka bentuk kuasa menjadi projek, bukan rak. Kedua, alat perisian yang memanfaatkan NVLink berskala rak adalah faktor penghalang untuk keuntungan throughput yang sebenar. Ketiga, kelajuan pemasangan dan penyelenggaraan adalah penting kerana satu dulang yang gagal dapat menghentikan tugas multi-rak.
NVL72 NVIDIA mengubah pusat graviti untuk infrastruktur latihan. Ia memihak kepada organisasi yang boleh melabur dalam kuasa dan penyejukan kampus atau hyperscale dan yang merancang perisian untuk menggunakan pautan semua-ke-semua yang rapat. Bagi yang lain, laluan yang masuk akal adalah pengambilan berperingkat: awan atau kolokasi untuk skala awal dan komitmen dalam premis yang disasarkan hanya setelah penggunaan tetap tinggi dan boleh diramalkan.




