Vera Rubin NVL72: Cơ sở hạ tầng đào tạo thế hệ tiếp theo có nghĩa là gì

Blog

Bởi Win.AI Editorial

NVL72 rack being installed in a data center, technicians connecting liquid cooling lines and monitoring LEDs

Vera Rubin NVL72 là câu trả lời của NVIDIA cho những hạn chế của các GPU quy mô máy chủ: một máy tinh chỉnh được xây dựng riêng, quy mô giá đỡ kết hợp sự phức tạp của cáp, gói gọn 72 GPU Rubin và 36 CPU Vera vào một khung máy làm mát bằng chất lỏng, và di chuyển băng thông bên trong giá đỡ để các mẫu lớn hơn hoạt động nhanh hơn mỗi watt. Thiết kế đó thay đổi các phương trình kinh tế đào tạo đồng thời đặt ra một lựa chọn sắc nét hơn giữa điện toán đám mây, đồng vị trí và mua phần cứng riêng của bạn.

Những đổi mới phần cứng và mạng của Vera Rubin NVL72

Các trang sản phẩm của NVIDIA và tài liệu kiến trúc tham khảo liệt kê các thay đổi cụ thể. Một giá đỡ GB300 NVL72 chứa 72 GPU Rubin và 36 CPU Grace/Vera, một môi trường NVLink được đánh giá khoảng 260 terabyte mỗi giây trên toàn bộ giá đỡ, tương đương khoảng 3,6 terabyte mỗi giây băng thông toàn bộ cho mỗi GPU, và các giá khay switch NVLink có thể thay thế nóng giúp loại bỏ cáp bên ngoài dài. NVIDIA tuyên bố có thể xử lý gấp 10 lần số token trên mỗi megawatt so với thế hệ GB200 trước đó. Giá đỡ hoàn toàn được làm mát bằng chất lỏng và các chỉ số công suất thường được trích dẫn nằm trong khoảng 120 đến 155 kilowatt tùy thuộc vào cấu hình và khối lượng công việc, vì vậy nhu cầu về điện năng và làm mát cho cơ sở hạ tầng là các hạn chế cấp một. Nguồn: trang sản phẩm và trang nhà phát triển của NVIDIA NVL72, tài liệu GB300 của HPE và Lenovo.

Những giao dịch thực tiễn cho người mua

Nếu bạn hoạt động với quy mô hyperscaler, toán học rất đơn giản. Hiệu suất cao hơn mỗi megawatt giảm chi phí năng lượng và giảm thời gian chờ cho các phiên đào tạo với tham số nhiều triệu tỷ. Môi trường NVLink giảm thiểu chi phí đồng bộ hóa giữa các GPU, điều đó làm giảm thời gian chạy đồng hồ đào tạo cho công việc mô hình song song chặt chẽ. Nếu bạn là một dịch vụ đám mây, điều đó có nghĩa là nhiều thông lượng hơn cho mỗi bay trung tâm dữ liệu.

Đối với các doanh nghiệp và phòng thí nghiệm, các thương lượng phức tạp hóa quyết định mua sắm. Phần cứng đòi hỏi hệ thống phân phối điện tùy chỉnh, các thanh bus DC 50 volt hoặc nhiều kệ điện 33 kW, tản nhiệt nước hoặc CDU vòng kín, và nhân viên có kinh nghiệm trong dịch vụ giá đỡ làm mát bằng chất lỏng. Những yếu tố này cung cấp hiệu suất nhưng thêm các khoản nâng cấp cố định cho cơ sở khó có thể phân bổ theo cách tốt cho việc sử dụng nhỏ hoặc cục bộ.

Một phản biện rõ ràng là đa dạng nhà cung cấp. Các bộ gia tốc và hệ thống thay thế như các chip chuyên biệt hoặc thiết bị loại Cerebras có các điểm tích hợp khác nhau và có thể tránh phụ thuộc vào NVLink. Các nhà cung cấp điện toán đám mây lớn đã trộn lẫn các loại gia tốc trong sản xuất, điều đó giảm thiểu rủi ro từ một nhà cung cấp duy nhất. Xem ví dụ lịch sử về các triển khai đám mây lớn của các bộ gia tốc thay thế để có ngữ cảnh Amazon triển khai công nghệ Cerebras nhanh gấp 25 lần.

Hướng dẫn quyết định và bài học quan sát

Nếu bạn cần khả năng đào tạo quy mô lớn ổn định, có thể dự đoán và vận hành hàng trăm giá đỡ, con đường NVL72 sẽ thường xuyên giảm thời gian chạy và chi phí năng lượng trên mỗi tham số. Nếu nhu cầu của bạn gián đoạn hoặc bị giới hạn ở hàng chục giá đỡ, hãy thuê trước. Các nhà cung cấp dịch vụ đồng vị trí sẽ cung cấp các điểm giữa nhưng hãy mong đợi giá cao cho đủ công suất và dung lượng CDU.

Chúng tôi đã quan sát thấy ba mô hình hoạt động lặp lại khi nghiên cứu các hệ thống NVL quy mô giá đỡ. Đầu tiên, thiết kế điện năng trở thành dự án, không phải là giá đỡ. Thứ hai, công cụ phần mềm khai thác môi trường NVLink cấp giá đỡ là yếu tố quyết định cho những lợi ích về thông lượng thực tế. Thứ ba, tốc độ lắp đặt và bảo trì rất quan trọng bởi vì một khay bị lỗi có thể dừng lại một công việc đa giá đỡ.

NVL72 của NVIDIA thay đổi trọng tâm cho cơ sở hạ tầng đào tạo. Nó yêu cầu các tổ chức có thể đầu tư vào điện và làm mát quy mô lớn hoặc hyperscale và có kế hoạch phần mềm để sử dụng các liên kết chặt chẽ toàn bộ. Đối với những người khác, con đường hợp lý là việc áp dụng từng giai đoạn: điện toán đám mây hoặc đồng vị trí cho quy mô ban đầu và chỉ cam kết trên-premise có mục tiêu khi mức sử dụng duy trì cao và có thể dự đoán.

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu