Vera Rubin NVL72: რა არის ახალი თაობის ტრენინგის ინფრასტრუქტურა
ავტორი: Win.AI Editorial

Vera Rubin NVL72 არის NVIDIA-ს პასუხი სერვერის მასშტაბის GPU-ების შეზღუდვებზე: სპეციალურად შექმნილი, რაკის ზომის მანქანა, რომელიც მალავს კაბელების სირთულეს, აკუმულირებს 72 Rubin GPU-სა და 36 Vera CPU-ს ერთ liquid-cooled კასკადში და ამცირებს ბანდუიტს რაკში, რათა უფრო დიდი მოდელები გაწვდოს უფრო სწრაფად ერთი ვატი მკვეთრად. აღნიშნული დიზაინი ცვლის ტრენინგის ეკონომიკის arithmetics-ს და მიკრო არჩევანს ქმნის ღრუბელს, კოლოკაციას და საკუთარი აპარატურის ათვისებას.
Vera Rubin NVL72-ის მოწყობილობა და ქსელური ინოვაციები
NVIDIA-ს პროდუქტის გვერდები და სარეფერენცო არქიტექტურის დოკუმენტაცია ცხადყოფს კონკრეტულ ცვლილებებს. GB300 NVL72 რაკში შედის 72 Rubin GPU და 36 Grace/Vera CPU, NVLink ქსელი შეფასებული დაახლოებით 260 ტერაბაიტად წამში მთელი რაკის მასშტაბით, რაც დაახლოებით 3.6 ტერაბაიტად წამში გადაცემას გადმოაქვს თითო GPU-ზე, და ცხელი შეცვლადი NVLink გადამყვანების თაროები, რომლებიც მოიხსნებიან გარე კაბელების შორს. NVIDIA აცხადებს, რომ 10-ჯერ უფრო მეტი ტობეკი არის მაქსიმალური მიგნებულ ვატში წინა GB200 თაობასთან შედარებით. რაკი სრულიად liquid-cooled და ჩვეულებრივ მოპოვებული ენერგიის ციფრები 120-155 კილოვატამდე მერყეობს კონფიგურაციისა და სამუშაოების მიხედვით, ამიტომ ობიექტურ ენერგიასა და გაგრილება პირველადი შეზღუდვებია. წყაროები: NVIDIA NVL72 პროდუქტისა და განვითარების გვერდები, HPE და Lenovo GB300 დოკუმენტაცია.
პრაქტიკული არჩევანი მყიდველებისთვის
თუ ჰიპერსკალერის მასშტაბზე ოპერირებთ, მათემატიკა მარტივია. მეტი ეფექტურობა თითო მღერე ენერგიის შემცირებასა და მრავალ-ტრილიონი პარამეტრებისთვის ტრენინგის დროზე ხარჯების შემცირებას იწვევს. NVLink ქსელი ამცირებს GPU-ების შორის სინქრონიზაციის ზარალს, რაც აჩქარებს ტრენინგის კორექტული დროის წმენდას მჭიდრო დაკავშირებული მოდელური პარალელური სამუშაოებისთვის. თუ თქვენ ღრუბელი ხართ, ეს უფრო მეტ throughput-ს ნიშნავს მონაცემთა ცენტრის ადგილებზე.
ორგანიზაციებისთვის და ლაბორატორიებისთვის არჩევნები აუმჯობესებს შეძენის გადაწყვეტილებებს. აპარატურა მოითხოვს შეკვეთით გაუგროვებულ ენერგიის განაწილებას, 50 ვოლტ DC ბოსბარები ან სხვადასხვა 33 კილოვატიანი ენერგიის სტენდები, გაგრილებული წყალი ან დახურული თანადინამიკური უნივერსალური ძრავები, და პერსონალი, რომელიც გამოცდილებაა liquid-cooled რაკის მომსახურებაში. ეს პროდუქტიულობას სიმაღლეზე გაიყვანს, მაგრამ აწვდის ფიქსირებულ ობიექტურ განახლებებს, რომლებსაც მცირე ან მოულოდნელი გამოყენების შემთხვევაში მცირე ამორტიზაცია აქვთ.
ერთი აშკარა საწინააღმდეგო არგუმენტი სარედაქციო მრავალფეროვნებაა. ალტერნატიული აჩქარებლები და სისტემები, როგორიცაა სპეციალურად შექმნილი ვაფერები ან Cerebras კლასის აპარატურა, აქვთ სხვადასხვა ინტეგრაციის წერტილები და შეუძლიათ ავიცილონ NVLink დამოკიდებულება. დიდმა ღრუბლებმა უკვე შეინახეს აჩქარებლების ტიპები წარმოებაში, რაც ამცირებს სინგლ-ვენდორ რისკს. იხილეთ ისტორიული მაგალითი დიდი ღრუბლი განვითარების ალტერნატიული აჩქარებლების Amazon 25-ჯერ უფრო სწრაფად გამოიყენებს Cerebras ტექნოლოგიას.
გადაწყვეტილების გიდი და დაკვირვებული გაკვეთილები
თუ გჭირდებათ დიდი მასშტაბის სტაბილური, პროგნოზირებადი ტრენინგის შესაძლებლობები და ასობით რაკზე ოპერირდებით, NVL72-ის გზა ჩვეულებრივ ამცირებს გამოყენების დროს და ენერგიის ხარჯვებს თითო პარამეტრზე. თუ თქვენი საჭიროებები პერიოდულია ან შეზღუდულია ათობით რაკზე, წინა ბუმი მიიღეთ. კოლოკაციის მომწვდელები ოთხ გზაში პროფესიონალური ფასიანობის საპონტაჟოდ პოზასო, მაგრამ მოელით პრემიუმ ფასები საკმარისი ენერგიის და CDU მოცულობისთვის.
ჩვენ ვაკვირდებოდით სამი განმეორებითი ოპერატიული ნიმუშების დროს NVL სისტემების შესწავლაში. პირველი, ენერგიის დიზაინი ხდება პროექტი, არა რაკი. მეორე, პროგრამული ხელსაწყო, რომელიც აფერხებს რაკის დონეზე NVLink-ს, არის რეალური throughput წარმოსახვის მძლავრი ფაქტორი. მესამისთვის, ინსტალაციის და მომსახურების სიჩქარე მნიშვნელოვან მნიშვნელობას ატარებს, რადგან ერთ-ერთი დავალებული თარო შეიძლება შეაჩეროს მრავალ რაკზე სამუშაო.
NVIDIA-ს NVL72 ცვლის სწავლების ინფრასტრუქტურის ცენტრებს. ეს კიდევ უფრო ხელსაყრელი ხდება ორგანიზაციებისთვის, რომლებიც შეძლებენ კამპუსი ან ჰიპერსკალარულ ელექტროობას და გაგრილებას და რომლებიც პროგრამულად გეგმავენ მჭიდრო, ყველა-მოახლოებული კავშირის გამოყენებისთვის. სხვებისთვის საუკეთესო გზა არის სტადიების მიღება: ღრუბელი ან კოლოკაცია საწყის მასშტაბზე და მიზნობრივი ოფლის ჩანაწერი მხოლოდ მაშინ, როცა გამოყენება მაღალი და პროგნოზირებადია.




