Vera Rubin NVL72: Yeni nesil eğitim altyapısı ne anlama geliyor
Win.AI Editorial tarafından

Vera Rubin NVL72, NVIDIA’nın sunucu ölçeğindeki GPU’ların sınırlarına verdiği bir yanıttır: kablo karmaşasını gizleyen, 72 Rubin GPU ve 36 Vera CPU’yu tek bir sıvı soğutmalı şasi içinde toplayan, rack ölçeğinde inşa edilmiş bir makine. Bu tasarım, daha büyük modellerin watt başına daha hızlı çalışmasını sağlamak için bant genişliğini rack içinden hareket ettiriyor. Bu tasarım, eğitim ekonomisinin matematiğini değiştirirken, bulut, kolokasyon ve kendi donanımınızı satın alma arasında daha keskin bir seçim yapmaya zorluyor.
Vera Rubin NVL72 donanım ve ağ yenilikleri
NVIDIA’nın ürün sayfaları ve referans mimari belgeleri somut değişiklikleri sıralıyor. Bir GB300 NVL72 rack'inde 72 Rubin GPU ve 36 Grace/Vera CPU bulunuyor, rack boyunca yaklaşık 260 terabayt/saniye olarak değerlendirilen bir NVLink yapısı var, bu da GPU başına yaklaşık 3.6 terabayt/saniye taşma bant genişliği sağlıyor ve uzun dış kabloları ortadan kaldıran sıcak değiştirme özellikli NVLink anahtar tepsileri ile geliyor. NVIDIA, önceki GB200 nesline kıyasla megawatt başına 10 kat daha fazla token sunduğunu iddia ediyor. Rack tamamen sıvı soğutmalı ve alıntılanan güç değerleri, yapılandırma ve iş yüküne bağlı olarak genellikle 120 ila 155 kilowatt arasında değişiyor, bu nedenle tesis gücü ve soğutma birinci derece kısıtlar. Kaynaklar: NVIDIA NVL72 ürün ve geliştirici sayfaları, HPE ve Lenovo GB300 belgeleri.
Alıcılar için pratik değişim noktaları
Eğer hiperscaler ölçeğinde faaliyet gösteriyorsanız, matematik basittir. Megawatt başına daha yüksek verimlilik, enerji harcamasını azaltır ve çok trilyon parametreli eğitim çalışmaları için duvar süresini düşürür. NVLink yapısı, GPU’lar arası senkronizasyon yükünü azaltır, bu da sıkı bir şekilde bağlı model paralel çalışması için eğitim duvar saati süresini kısaltır. Eğer bir bulut hizmeti sunuyorsanız, bu daha fazla veri merkezi yuvası başına daha fazla çıktı anlamına gelir.
Kuruluşlar ve laboratuvarlar için değişim noktaları, alım kararlarını karmaşıklaştırır. Donanım, özel güç dağıtımını, 50 volt DC baralar veya birden fazla 33 kW güç rafı, soğutulmuş su veya kapalı devre CDU'lar ve sıvı soğutmalı rack hizmetinde deneyimli personel talep eder. Bunlar performansı artırır ancak küçük veya patlayıcı kullanımlarda amorti edilmesi zor olan sabit tesis yükseltmelerini ekler.
Açık bir karşı tartışma noktası, tedarikçi çeşitliliğidir. Amaçlı olarak inşa edilmiş wafer’lar veya Cerebras sınıfı cihazlar gibi alternatif hızlandırıcılar ve sistemler, farklı entegrasyon noktalarına sahip olabilir ve NVLink bağımlılığını önleyebilir. Büyük bulut sağlayıcıları, üretimde zaten farklı hızlandırıcı türlerini bir araya getirmiştir, bu da tek tedarikçi riskini azaltır. Bağlam için alternatif hızlandırıcıların büyük bulut dağıtımları üzerine tarihi örneğe bakın Amazon, Cerebras teknolojisini 25 kat daha hızlı dağıtıyor.
Karar rehberi ve gözlemlenen dersler
Sürekli, öngörülebilir büyük ölçekli eğitim kapasitesine ihtiyacınız varsa ve yüzlerce rack işletiyorsanız, NVL72 yolu genellikle çalıştırma süresini ve enerji maliyetini azaltacaktır. İhtiyaçlarınız aralıklı veya onlara sınırlıysa, önce kiralayın. Kolokasyon sağlayıcıları orta noktalar sunacak, ancak yeterli güç ve CDU kapasitesi için yüksek fiyatlar bekleyin.
Rack ölçeğindeki NVL sistemlerini incelerken üç tekrarlayan operasyonel modeli gözlemledik. İlk olarak, güç tasarımı proje haline gelir, rack değil. İkincisi, rack-düzeyindeki NVLink'i kullanan yazılım araçları, gerçek çıktı kazançları için engel teşkil eder. Üçüncüsü, kurulum ve servis hızı önemlidir çünkü tek bir başarısız tepsi, çok rack’li bir işi durdurabilir.
NVIDIA’nın NVL72, eğitim altyapısı için yer çekim merkezini değiştiriyor. Kampüs veya hiperscale güç ve soğutmaya yatırım yapabilen ve sıkı tüm bağlantıları kullanacak yazılımlar planlayan organizasyonları destekliyor. Diğer herkes için mantıklı yol, aşamalı benimsemedir: başlangıç ölçeği için bulut veya kolokasyon ve sadece kullanım yüksek ve öngörülebilir olduğunda hedeflenmiş yerel taahhüt.




