Vera Rubin NVL72:次世代トレーニングインフラの意味
執筆:Win.AI Editorial

Vera Rubin NVL72は、サーバースケールのGPUの限界に対するNVIDIAの答えです。ケーブルの複雑さを隠し、72個のRubin GPUと36個のVera CPUを1つの液冷シャーシにパックし、ラック内での帯域幅を移動することで、より大きなモデルがワットあたりより速く動くように設計された専用ラックスケールマシンです。この設計はトレーニング経済の算数を変えると同時に、クラウド、コロケーション、自前のハードウェアの選択を一層重要にします。
Vera Rubin NVL72のハードウェアとネットワークの革新
NVIDIAの製品ページとリファレンスアーキテクチャの文書は、具体的な変更点を列挙しています。GB300 NVL72ラックには72個のRubin GPUと36個のGrace/Vera CPUが含まれており、ラック全体で約260テラバイト毎秒に評価されるNVLinkファブリックが用意されています。これにより、GPUごとに約3.6テラバイト毎秒の全対全の帯域幅が得られ、長い外部ケーブルを除去するホットスワップ可能なNVLinkスイッチトレイがあり、NVIDIAは前世代のGB200と比べて最大10倍のトークンをメガワットあたりで処理できると主張しています。このラックは完全に液冷されており、一般的に引用される電力値は構成と作業負荷に応じて120から155キロワットの範囲です。したがって、施設の電力と冷却は一次的な制約です。出典:NVIDIA NVL72製品および開発者ページ、HPEおよびLenovoのGB300文書。
購買者の実践的トレードオフ
ハイパースケーラーの規模で運営している場合、計算はシンプルです。メガワットあたりの効率が向上すると、エネルギー支出が減少し、多兆パラメータのトレーニングランの壁時間が短縮されます。NVLinkファブリックは、GPU間の同期オーバーヘッドを減少させ、厳密に結合されたモデル並列作業のトレーニング壁時計時間を短縮します。クラウドサービスの場合、これはデータセンターのベイごとのスループットの向上に繋がります。
企業やラボの場合、トレードオフが取得の決定を複雑化させます。ハードウェアは特注の電力配分を必要とし、50ボルトのDCバスバーまたは複数の33kW電源棚、冷却水や閉ループCDU、液冷ラックサービスに経験豊富なスタッフを必要とします。これらは性能を向上させますが、小規模または突発的な使用の下では償却が難しい固定的な施設のアップグレードを追加します。
1つの明白な反論はベンダーの多様化です。専用のウェーハやCerebrasクラスのアプライアンスなどの代替アクセラレーターやシステムは、異なる統合ポイントを持ち、NVLink依存を回避できます。大手クラウドプロバイダーはすでに生産においてアクセラレーターの種類を混在させており、単一ベンダーのリスクを減少させています。参考までに代替アクセラレーターの大規模クラウド展開の歴史的な例を見てください AmazonがCerebras技術を25倍速く導入する。
決定ガイドと観察された教訓
持続可能で予測可能な大規模トレーニング容量が必要であり、数百のラックを運営している場合、NVL72の経路は通常、パラメータごとのランタイムとエネルギーコストを削減します。一方、ニーズが断続的であったり数十のラックに制限されている場合は、まずレンタルをお勧めします。コロケーションプロバイダーは中間的な選択肢を提供しますが、十分な電力とCDU能力のためにプレミアム価格が予想されます。
ラックスケールのNVLシステムを研究している間、私たちは3つの繰り返し現れる運用パターンを観察しました。まず、電力設計がプロジェクトとなり、ラックではなくなります。次に、ラックレベルのNVLinkを活用するソフトウェアツールが真のスループット向上のゲーティングファクターとなります。最後に、インストールとサービスの速度が重要です。なぜなら、1つのトレイが故障すると、複数のラックの作業が停止する可能性があるからです。
NVIDIAのNVL72はトレーニングインフラの重心を変えます。キャンパスやハイパースケールの電力と冷却に投資でき、タイトな全対全リンクを使用するソフトウェアを計画する組織に有利です。それ以外の人々にとっては、合理的な進行方法は段階的な導入です。初期のスケールにはクラウドやコロケーションを利用し、以後は利用率が高く予測可能になってからターゲットを絞ったオンプレミスのコミットメントを行うべきです。




