Vera Rubin NVL72: अगली पीढ़ी के प्रशिक्षण अवसंरचना का मतलब क्या है
Win.AI Editorial द्वारा

Vera Rubin NVL72 NVIDIA का सर्वर-स्केल GPUs की सीमाओं के लिए उत्तर है: एक उद्देश्य-निर्मित, रैक-स्केल मशीन जो केबल की जटिलता को छिपाती है, एक ही तरल-ठंडा चेसिस में 72 Rubin GPUs और 36 Vera CPUs पैक करती है, और बड़े मॉडलों को प्रति वाट तेज़ चलाने के लिए रैक के अंदर बैंडविड्थ स्थानांतरित करती है। यह डिज़ाइन प्रशिक्षण अर्थशास्त्र की गणना को बदलता है जबकि क्लाउड, कोलोकेशन और अपना खुद का हार्डवेयर खरीदने के बीच एक तेज़ विकल्प का सामना कराता है।
Vera Rubin NVL72 हार्डवेयर और नेटवर्क नवाचार
NVIDIA के उत्पाद पृष्ठ और संदर्भ आर्किटेक्चर दस्तावेज़ ठोस परिवर्तनों की सूची देते हैं। एक GB300 NVL72 रैक में 72 Rubin GPUs और 36 Grace/Vera CPUs होते हैं, एक NVLink फैब्रिक जो रैक के पार लगभग 260 टेराबाइट प्रति सेकंड की रेटिंग रखता है, जो प्रति GPU लगभग 3.6 टेराबाइट प्रति सेकंड की सभी से सभी बैंडविड्थ पर पहुंचता है, और हॉट-स्वैपेबल NVLink स्विच ट्रे हैं जो लंबे बाहरी केबलों को हटा देती हैं। NVIDIA का दावा है कि पिछले GB200 पीढ़ी की तुलना में प्रति मेगावाट 10 गुना अधिक टोकन मिलते हैं। रैक पूरी तरह से तरल ठंडा है और सामान्यतः जिन पावर आंकड़ों का उल्लेख किया जाता है, वे कॉन्फ़िगरेशन और कार्यभार के आधार पर 120 से 155 किलोवाट रेंज में होते हैं, इसलिए सुविधा की शक्ति और ठंडा करना पहले-आदेश की बाधाएं हैं। स्रोत: NVIDIA NVL72 उत्पाद और डेवलपर पृष्ठ, HPE और Lenovo GB300 दस्तावेज़।
खरीदारों के लिए व्यावहारिक व्यापार-बंद
यदि आप हाइपरस्केल स्तर पर काम करते हैं, तो गणित सरल है। प्रति मेगावाट उच्च दक्षता ऊर्जा खर्च को कम करती है और बहु-ट्रिलियन पैरामीटर प्रशिक्षण चलाने के लिए दीवार के समय को कम करती है। NVLink फैब्रिक GPU समन्वय ओवरहेड को कम करती है, जो तंग युग्मित मॉडल समानांतर कार्य के लिए प्रशिक्षण दीवार घड़ी के समय को कम करती है। यदि आप एक क्लाउड हैं, तो इसका मतलब है कि डेटा सेंटर बे के लिए अधिक थ्रूपुट।
उद्यमों और प्रयोगशालाओं के लिए व्यापार-बंद अधिग्रहण निर्णयों को जटिल बनाते हैं। हार्डवेयर को कस्टम पावर वितरण, 50 वोल्ट DC बसबार या कई 33 kW पावर शेल्व, ठंडी पानी या बंद-चक्र CDU, और तरल-ठंडा रैक सेवा में अनुभवी स्टाफ की आवश्यकता होती है। ये प्रदर्शन को सक्षम करते हैं लेकिन ऐसे फिक्स्ड सुविधा उन्नयन को जोड़ते हैं जो छोटे या फटने वाले उपयोग के तहत अमोर्तिज़ करना कठिन होता है।
एक स्पष्ट विरोधाभास विक्रेता विविधीकरण है। वैकल्पिक त्वरक और सिस्टम जैसे उद्देश्य-निर्मित वेफर्स या Cerebras-स्तरीय उपकरण में विभिन्न एकीकरण बिंदु होते हैं और NVLink निर्भरता से बच सकते हैं। बड़े क्लाउड प्रदाता पहले से ही उत्पादन में त्वरक प्रकारों को मिश्रित कर चुके हैं, जिससे एकल विक्रेता का जोखिम कम होता है। संदर्भ के लिए वैकल्पिक त्वरकों के बड़े क्लाउड डिप्लॉयमेंट का ऐतिहासिक उदाहरण देखें Amazon deploys Cerebras technology 25 times faster than。
निर्णय गाइड और अवलोकित पाठ
यदि आपको निरंतर, पूर्वानुमानित बड़े पैमाने पर प्रशिक्षण क्षमता की आवश्यकता है और आप सैकड़ों रैक पर काम करते हैं तो NVL72 मार्ग आमतौर पर प्रति पैरामीटर रन समय और ऊर्जा लागत को कम करेगा। यदि आपकी आवश्यकताएँ बीच-बीच में या दर्जनों रैक तक सीमित हैं तो पहले किराए पर लें। कोलोकेशन प्रदाता मध्य बिंदुओं की पेशकश करेंगे लेकिन पर्याप्त पावर और CDU क्षमता के लिए प्रीमियम मूल्य की अपेक्षा करें।
हमने रैक-स्तरीय NVL सिस्टम का अध्ययन करते समय तीन दोहराए जाने वाले संचालन पैटर्न देखे। पहला, पावर डिज़ाइन प्रोजेक्ट बन जाता है, न कि रैक। दूसरा, सॉफ़्टवेयर उपकरण जो रैक स्तर के NVLink का लाभ उठाते हैं, वास्तविक थ्रुपुट लाभ के लिए बाधा कारक होते हैं। तीसरा, स्थापना और सेवा की गति महत्वपूर्ण होती है क्योंकि एकल विफल ट्रे एक बहु-रैक काम को रोक सकती है।
NVIDIA का NVL72 प्रशिक्षण अवसंरचना के लिए गुरुत्वाकर्षण के केंद्र को बदलता है। यह उन संगठनों को पसंद करता है जो परिसर या हाइपरस्केल पावर और ठंडक में निवेश कर सकते हैं और जो तंग सभी-से-सभी कड़ियों का उपयोग करने के लिए सॉफ़्टवेयर की योजना बनाते हैं। बाकी सभी के लिए समझदारी भरा रास्ता चरणबद्ध गोद लेना है: प्रारंभिक पैमाने के लिए क्लाउड या कोलोकेशन और केवल तब लक्षित ऑन-प्रेम प्रतिबद्धता जब उपयोग उच्च और पूर्वानुमानित रहे।




