Vera Rubin NVL72: Τι σημαίνει για την εκπαίδευση επόμενης γενιάς
Από Win.AI Editorial

Η Vera Rubin NVL72 είναι η απάντηση της NVIDIA στα όρια των GPU κλίμακας διακομιστών: μια ειδικά κατασκευασμένη, μηχανή κλίμακας ραφιού που κρύβει την πολυπλοκότητα των καλωδίων, έχει 72 GPUs Rubin και 36 CPUs Vera σε μια ενιαία ψυκτική θήκη, και μετακινεί το εύρος ζώνης μέσα στο ράφι ώστε τα μεγαλύτερα μοντέλα να τρέχουν πιο γρήγορα ανά watt. Αυτή η σχεδίαση αλλάζει τα οικονομικά της εκπαίδευσης ενώ αναγκάζει σε μια πιο οξεία επιλογή μεταξύ του νέφους, της συγκέντρωσης και της αγοράς του υλικού σας.
Καινοτομίες υλικού και δικτύου της Vera Rubin NVL72
Οι σελίδες προϊόντων της NVIDIA και η τεκμηρίωση αναφοράς αρχιτεκτονικής απαριθμούν τις συγκεκριμένες αλλαγές. Ένα ράφι GB300 NVL72 περιέχει 72 GPUs Rubin και 36 CPUs Grace/Vera, μια δομή NVLink που αποτιμάται σε περίπου 260 terabytes ανά δευτερόλεπτο σε όλο το ράφι, που μεταφράζεται σε περίπου 3.6 terabytes ανά δευτερόλεπτο συνολικής διασύνδεσης ανά GPU, και θήκες διακοπτών NVLink που μπορούν να αντικαθίστανται χωρίς σβήσιμο, οι οποίες αφαιρούν τα μεγάλα εξωτερικά καλώδια. Η NVIDIA ισχυρίζεται ότι προσφέρει έως και 10 φορές περισσότερους tokens ανά μεγαβάτ σε σύγκριση με την προηγούμενη γενιά GB200. Το ράφι είναι πλήρως υγρών ψύξης και οι συνηθισμένες αναφερόμενες τιμές ισχύος κυμαίνονται από 120 έως 155 κιλοβάτ ανάλογα με τη διαμόρφωση και το φόρτο εργασίας, επομένως η ισχύς και η ψύξη της εγκατάστασης είναι πρωτογενείς περιορισμοί. Πηγές: σελίδες προϊόντων και προγραμματιστών της NVIDIA NVL72, τεκμηρίωση GB300 της HPE και Lenovo.
Πρακτικοί περιορισμοί για τους αγοραστές
Εάν λειτουργείτε σε κλίμακα hyperscaler, τα μαθηματικά είναι απλά. Η υψηλότερη αποδοτικότητα ανά μεγαβάτ μειώνει την ενεργειακή δαπάνη και μειώνει τον χρόνο τοίχου για εκπαιδευτικούς κύκλους με παραμέτρους πολλών τρισεκατομμυρίων. Η δομή NVLink μειώνει την υπερφόρτωση συγχρονισμού μεταξύ GPU, γεγονός που μειώνει τον χρόνο τοίχου εκπαίδευσης για προσεκτικά συνδυασμένες παράλληλες εργασίες μοντέλων. Εάν είστε νέφος, αυτό μεταφράζεται σε περισσότερη ροή ανά θάλαμο δεδομένων του κέντρου.
Για επιχειρήσεις και εργαστήρια, οι περιορισμοί περιπλέκουν τις αποφάσεις απόκτησης. Η υλική υποδομή απαιτεί ειδική διανομή ισχύος, 50 βολτ DC busbars ή πολλές 33 kW ράφια τροφοδοσίας, ψυχρού νερού ή κλειστού κύκλωμα CDU και προσωπικό έμπειρο στην υπηρεσία ραφιού υγρού ψύξης. Αυτά επιτρέπουν απόδοση αλλά προσθέτουν σταθερές αναβαθμίσεις εγκαταστάσεων που είναι δύσκολο να αποσβεστούν κάτω από μικρή ή ξαφνική χρήση.
Ένα προφανές αντεπιχείρημα είναι η διαφοροποίηση προμηθευτών. Εναλλακτικοί επιταχυντές και συστήματα όπως κατασκευασμένα wafers ή τα μηχανήματα αναλογίας Cerebras έχουν διαφορετικά σημεία ενσωμάτωσης και μπορούν να αποφύγουν την εξάρτηση από NVLink. Οι μεγάλοι πάροχοι νέφους έχουν ήδη αναμείξει τύπους επιταχυντών στην παραγωγή, γεγονός που μειώνει τον κίνδυνο από μονό προμηθευτή. Δείτε το ιστορικό παράδειγμα μεγάλων αναπτύξεων νέφους εναλλακτικών επιταχυντών για πλαίσιο Η Amazon αναπτύσσει την τεχνολογία Cerebras 25 φορές ταχύτερα από.
Οδηγός απόφασης και παρατηρούμενα διδάγματα
Εάν χρειάζεστε διαρκή, προβλέψιμη χωρητικότητα εκπαίδευσης μεγάλης κλίμακας και λειτουργείτε εκατοντάδες ράφια, ο δρόμος NVL72 θα μειώσει συνήθως τον χρόνο λειτουργίας και το κόστος ενέργειας ανά παράμετρο. Εάν οι ανάγκες σας είναι διαλείπουσες ή περιορίζονται σε δεκάδες ράφια, ενοικιάστε πρώτα. Οι προμηθευτές συγκέντρωσης θα προσφέρουν μεσαία σημεία, αλλά αναμείνατε premium τιμολόγηση για επαρκή ισχύ και ικανότητα CDU.
Παρατηρήσαμε τρία επαναλαμβανόμενα επιχειρηματικά μοτίβα κατά τη μελέτη των συστημάτων NVL κλίμακας ραφιού. Πρώτον, ο σχεδιασμός ισχύος γίνεται το έργο, όχι το ράφι. Δεύτερον, τα εργαλεία λογισμικού που εκμεταλλεύονται το NVLink σε επίπεδο ραφιού είναι ο περιοριστικός παράγοντας για πραγματικά κέρδη ροής. Τρίτον, η ταχύτητα εγκατάστασης και συντήρησης είναι σημαντική γιατί μια μόνο αποτυχημένη θήκη μπορεί να σταματήσει μια εργασία πολλών ραφιών.
Η NVL72 της NVIDIA αλλάζει το κέντρο βάρους για την υποδομή εκπαίδευσης. Ευνοεί οργανισμούς που μπορούν να επενδύσουν σε ισχύ και ψύξη σε πανεπιστημιούπολη ή κλίμακα hyperscale και που σχεδιάζουν λογισμικό για να χρησιμοποιούν σφιχτούς δεσμούς all-to-all. Για όλους τους άλλους, η λογική πορεία είναι η σταδιακή υιοθέτηση: νέφος ή συγκέντρωση για αρχική κλίμακα και στοχευμένη δέσμευση σε τοπικό επίπεδο μόνο όταν η εκμετάλλευση παραμένει υψηλή και προβλέψιμη.




