Vera Rubin NVL72: Ano ang ibig sabihin ng next gen training infra
Ni Win.AI Editorial

Ang Vera Rubin NVL72 ay sagot ng NVIDIA sa mga limitasyon ng server-scale GPUs: isang layuning makina na may sukat rack na nagtatago sa kumplikadong kable, naglalaman ng 72 Rubin GPUs at 36 Vera CPUs sa isang solong liquid-cooled na chassis, at inililipat ang bandwidth sa loob ng rack kaya mas mabilis ang pagtakbo ng mas malaking modelo kada watt. Ang disenyo na ito ay nagbabago sa aritmetika ng training economics habang pinipilit ang mas matalim na pagpili sa pagitan ng cloud, colocation at pagbili ng sariling hardware.
Mga inobasyon sa hardware at network ng Vera Rubin NVL72
Ang mga pahina ng produkto ng NVIDIA at dokumentasyon ng reference architecture ay binibilang ang mga kongkretong pagbabago. Ang isang GB300 NVL72 rack ay naglalaman ng 72 Rubin GPUs at 36 Grace/Vera CPUs, isang NVLink fabric na na-rate sa humigit-kumulang 260 terabytes bawat segundo sa buong rack na naglalarawan ng mga 3.6 terabytes bawat segundo ng all-to-all bandwidth bawat GPU, at hot-swappable NVLink switch trays na nag-aalis ng mahabang panlabas na mga kable. Inihahambing ng NVIDIA ang hanggang 10 beses na higit pang tokens bawat megawatt kumpara sa nakaraang henerasyong GB200. Ang rack ay ganap na liquid cooled at ang karaniwang sinasabi na mga numerong power ay nasa 120 hanggang 155 kilowatt depende sa configuration at workload, kaya ang kapangyarihan at paglamig ng pasilidad ay mga unang pagkukulang. Mga mapagkukunan: NVIDIA NVL72 produkto at developer pages, HPE at Lenovo GB300 dokumentasyon.
Praktikal na trade-offs para sa mga bumibili
Kung ikaw ay humahawak sa hyperscaler scale, simple lang ang matematika. Ang mas mataas na kahusayan bawat megawatt ay nagpapababa ng gastusin sa enerhiya at nagpapababa ng wall time para sa multi-trillion parameter training runs. Ang NVLink fabric ay nagpapababa ng overhead ng inter-GPU synchronization, na nagpapababa ng training wall clock time para sa mahigpit na magkakaugnay na model parallel work. Kung ikaw ay nasa cloud, nagiging mas maraming throughput ito sa bawat data center bay.
Para sa mga negosyo at laboratoryo, ang mga trade-offs ay nagpapalabo sa mga desisyon sa acquisition. Ang hardware ay nangangailangan ng bespoke na pamamahagi ng kapangyarihan, 50 volt DC busbars o maraming 33 kW power shelves, chilled water o closed-loop CDUs, at mga tauhan na may karanasan sa liquid-cooled rack service. Ang mga ito ay nagpapagana ng performance ngunit nagdadala ng mga fixed facility upgrades na mahirap i-amortize sa ilalim ng maliit o nagliliyab na paggamit.
Isang halata na salungat na argumento ay ang vendor diversification. Ang mga alternatibong accelerator at sistema tulad ng mga layunin na wafer o Cerebras-class appliances ay may iba't ibang integration points at maaaring iwasan ang NVLink dependency. Ang malalaking cloud provider ay nakapaghalo na ng mga uri ng accelerator sa produksyon, na nagpapababa ng panganib sa iisang vendor. Tingnan ang historikal na halimbawa ng malalaking cloud deployments ng mga alternatibong accelerator para sa konteksto Amazon deploys Cerebras technology 25 times faster than.
Gabay sa desisyon at mga aral na natutunan
Kung kailangan mo ng tuloy-tuloy, mahuhulaan na malaking kapasidad ng training at may daan-daang racks, kadalasang bababa ang runtime at gastos sa enerhiya bawat parameter sa NVL72 path. Kung ang iyong pangangailangan ay pana-panahon o nakatali sa ilang dosenang racks, unahin ang pag-upa. Ang mga provider ng colocation ay mag-aalok ng mga midpoint ngunit asahan ang premium pricing para sa sapat na kapangyarihan at kapasidad ng CDU.
Nakita namin ang tatlong umuulit na operational patterns habang pinag-aaralan ang rack-scale NVL systems. Una, ang disenyo ng kapangyarihan ang nagiging proyekto, hindi ang rack. Pangalawa, ang software tooling na gumagamit ng rack-level NVLink ang nagiging hadlang para sa tunay na pagtaas ng throughput. Pangatlo, mahalaga ang bilis ng pag-install at serbisyo dahil ang isang nabigong tray ay maaaring huminto sa isang multi-rack na trabaho.
Binabago ng NVIDIA ang NVL72 ang gitnang punto ng training infrastructure. Pinasisigla nito ang mga organisasyon na makakapag-invest sa campus o hyperscale power at cooling at magplano ng software upang gamitin ang mahigpit na all-to-all links. Para sa lahat ng iba pa, ang maka-sensible na landas ay staged adoption: cloud o colocation para sa paunang scale at isang targeted on-prem commitment lamang kapag ang paggamit ay nananatiling mataas at mahuhulaan.




