ভেরা রুবিন NVL72: পরবর্তী প্রজন্মের প্রশিক্ষণ অবকাঠামোর অর্থ
লেখক: Win.AI Editorial

ভেরা রুবিন NVL72 এনভিডিয়ার সার্ভার স্কেলের GPU-এর সীমাবদ্ধতার উত্তর: একটি উদ্দেশ্যভিত্তিক, র্যাক-মহল মেশিন যা ক্যাবল জটিলতাকে লুকিয়ে রাখে, একক তরল-শীতল শাসকের মধ্যে 72 রুবিন GPU এবং 36 ভেরা CPU সংহত করে এবং র্যাকের মধ্যে ব্যান্ডউইথ স্থানান্তর করে যাতে বড় মডেলগুলি প্রতি ওয়াটে দ্রুত চলে। সেই ডিজাইন প্রশিক্ষণের অর্থনীতির গাণিতিক পরিবর্তন ঘটায়, যখন এটি ক্লাউড, সমবায় এবং নিজের হার্ডওয়্যার কেনার মধ্যে একটি তীক্ষ্ণ পছন্দ বাধ্য করে।
ভেরা রুবিন NVL72 হার্ডওয়্যার এবং নেটওয়ার্ক উদ্ভাবন
এনভিডিয়ার পণ্য পৃষ্ঠা এবং রেফারেন্স আর্কিটেকচার ডকুমেন্টেশন কনক্রিট পরিবর্তনগুলিকে নির্দিষ্ট করে। একটি GB300 NVL72 র্যাক 72 রুবিন GPU এবং 36 গ্রেস/ভেরা CPU ধারণ করে, একটি NVLink ফ্যাব্রিক যা রাক জুড়ে প্রায় 260 টেরাবাইট প্রতি সেকেন্ড রেট করা হয় যা সমস্ত GPU-এর জন্য প্রায় 3.6 টেরাবাইট প্রতি সেকেন্ডের সব থেকে সব ব্যান্ডউইথ হিসাবে কাজ করে, এবং উষ্ণ-সোয়াপযোগ্য NVLink সুইচ ট্রে যা দীর্ঘ বাইরের ক্যাবল অপসারণ করে। এনভিডিয়া পূর্ববর্তী GB200 প্রজন্মের তুলনায় প্রতি মেগাওয়াটে 10 গুণ বেশি টোকেন পাওয়ার দাবি করে। র্যাকটি সম্পূর্ণ তরল শীতল এবং সাধারণত উদ্ধৃত শক্তির সংখ্যা কনফিগারেশন এবং কর্মের উপর নির্ভর করে 120 থেকে 155 কিলোওয়াটের মধ্যে চলে, তাই সুবিধার শক্তি এবং শীতলকরণ হলো প্রথম-শ্রেণীর সীমাবদ্ধতা। উৎস: এনভিডিয়া NVL72 পণ্য এবং ডেভেলপার পৃষ্ঠা, HPE এবং লেনোভো GB300 ডকুমেন্টেশন।
ক্রেতাদের জন্য বাস্তবিক বিনিময়
যদি আপনি হাইপারস্কেলার স্কেলে কাজ করেন তাহলে গণনা সহজ। প্রতি মেগাওয়াটে উচ্চতর কার্যকারিতা শক্তি ব্যয় হ্রাস করে এবং শত ট্রিলিয়ন প্যারামিটার প্রশিক্ষণ রানগুলোর জন্য প্রাচীরের সময় কমায়। NVLink ফ্যাব্রিক GPU-এর মধ্যে সমন্বয় ব্যায় হ্রাস করে, যা সংযুক্ত মডেল প্যারালাল কাজের জন্য প্রশিক্ষণ প্রাচীর ঘড়ির সময় কমায়। যদি আপনি একটি ক্লাউড হন, তাহলে এটি ডেটা সেন্টার বেই-এ আরও প্রবাহে অনুবাদ হয়।
এন্টারপ্রাইজ এবং গবেষণাগুলোর জন্য, বিনিময় গ্রহণের সিদ্ধান্তকে জটিল করে। হার্ডওয়্যারের চাহিদা কাস্টম পাওয়ার ডিস্ট্রিবিউশন, 50 ভোল্ট DC বাসবার বা একাধিক 33 কিলোওয়াট পাওয়ার শেল্ভ, ঠান্ডা জল বা বন্ধ লুপ CDU, এবং তরল শীতল র্যাক পরিষেবায় অভিজ্ঞ কর্মী। এসব কর্মক্ষমতা সক্ষম করে কিন্তু ছোট বা বাষ্পহীন ব্যবহারের অধীনে ঋণপ্রদান করা কঠিন স্থির সুবিধা আপগ্রেড যোগ করে।
একটি স্পষ্ট পাল্টা যুক্তি হলো বিক্রেতার বৈচিত্র্য। উদ্দেশ্যযুক্ত ওয়েফার বা সেরেব্রাস-ক্লাস যন্ত্রের মতো বিকল্প অ্যাক্সেলরেটর এবং সিস্টেমগুলোর বিভিন্ন মিশ্রণ পয়েন্ট রয়েছে এবং NVLink নির্ভরতা এড়াতে পারে। বড় ক্লাউড সরবরাহকারীরা ইতিমধ্যেই উৎপাদনে অ্যাক্সেলরেটরের বিভিন্ন ধরন মিশ্রিত করেছে, যা একক বিক্রেতার ঝুঁকি কমায়। প্রেক্ষাপটের জন্য বিকল্প অ্যাক্সেলরেটরগুলোর ঐতিহাসিক উদাহরণ দেখুন অ্যামাজন সেরেব্রাস প্রযুক্তি 25 গুণ বেশি দ্রুত মোতায়েন করে।
সিদ্ধান্ত গাইড এবং অভিজ্ঞতায় দেখা পাঠ
যদি আপনার ধারাবাহিক, পূর্বাভাসযোগ্য বৃহত্তম প্রশিক্ষণ ক্ষমতার প্রয়োজন হয় এবং আপনি শত শত র্যাক পরিচালনা করেন তবে NVL72 পথ সাধারণত প্যারামিটার প্রতি রান টাইম এবং শক্তির খরচ কমাবে। যদি আপনার প্রয়োজনগুলো অনিয়মিত বা কিছু র্যাকের মধ্যে আবদ্ধ হয় তবে প্রথমে ভাড়া নিন। সমবায় সরবরাহকারীরা মধ্যপন্থা অফার করবে কিন্তু যথাযথ শক্তি এবং CDU ধারণার জন্য প্রিমিয়াম মূল্য আশা করুন।
আমরা র্যাক-মহল NVL সিস্টেম অধ্যয়ন করতে সময়কালীন তিনটি পুনরাবৃত্ত অপারেশনাল প্যাটার্ন পর্যবেক্ষণ করেছি। প্রথমত, পাওয়ার ডিজাইন প্রকল্প হয়ে ওঠে, র্যাক নয়। দ্বিতীয়ত, এমন সফটওয়্যার টুলিং যা র্যাক-স্তরের NVLink ব্যবহার করে তা বাস্তব throughput বৃদ্ধির জন্য প্রধান বাধা। তৃতীয়ত, ইনস্টলেশন এবং পরিষেবা গতির গুরুত্ব রয়েছে কারণ একটি একক ব্যর্থ ট্রে একটি বহু-র্যাক কাজ থামাতে পারে।
এনভিডিয়ার NVL72 প্রশিক্ষণ অবকাঠামোর কেন্দ্রের ভারসাম্য পরিবর্তন করে। এটি সেই সংস্থাগুলোর পক্ষে সুবিধাজনক যারা ক্যাম্পাস বা হাইপারস্কেল পাওয়ার এবং শীতলকরণে বিনিয়োগ করতে পারে এবং যারা টাইট অল-টু-অল লিঙ্ক ব্যবহারের জন্য সফটওয়্যার পরিকল্পনা করে। অন্যদের জন্য যুক্তিযুক্ত পথ হলো পর্যায়িত গ্রহণ: প্রাথমিক স্কেলের জন্য ক্লাউড বা সমবায় এবং শুধুমাত্র একবার ব্যবহার উচ্চ ও পূর্বাভাসযোগ্য হলে লক্ষ্যিত অন-প্রেম প্রতিশ্রুতি।




