NVIDIA GB300 NVL72がMoE事前学習の世界記録を樹立:AI基盤モデル開発を加速
NVIDIA GB300 NVL72によるMoE事前学習の世界記録達成
NVIDIAは、GB300 NVL72システムが、Mixture-of-Experts (MoE) モデルの事前学習において、GPUあたり1,648 TFLOPsという世界記録を樹立したことを発表しました。この記録は、DeepSeek-V3 671Bモデルの事前学習に256基のGPUを使用することで達成され、従来のGB200 NVL72の結果と比較して、1GPUあたりのスループットを約3倍向上させています。この性能向上は、AIプラットフォーム全体の進歩、特にシリコンからネットワーキング、ソフトウェアに至るまでの一貫した最適化によって実現されました。
MoEアーキテクチャは、その計算効率の高さから業界で急速に採用が進んでおり、NVIDIAはMegatron Coreなどのソフトウェア最適化を通じて、GB300 NVL72のポテンシャルを最大限に引き出しています。同システムは、GB200 NVL72と比較して、同じ規模で最大1.6倍高速な学習を実現しており、これはより高い計算密度、拡張されたメモリ、および増大した電力容量によってもたらされています。
GB300 NVL72の技術的優位性とMoE最適化戦略
NVIDIA GB300 NVL72は、72基のNVIDIA Blackwell Ultra GPUと36基のGrace CPUを統合した液冷式ラック・スケール・システムです。このシステムは、第5世代のNVLink技術によってすべて相互接続されており、GPUあたり1.8 TB/sの帯域幅と130 TB/sのノンブロッキング・オール・ツー・オール帯域幅を提供することで、高効率なMoEアーキテクチャのスケーリングを可能にしています。NVLinkはメモリセマンティックであり、GPUがピアのHBMに直接、ネイティブのロードおよびストア操作としてアクセスできるため、データパスにおけるレイテンシを排除します。
MoEモデルは、スパースなアクティベーションとエキスパート並列処理により、計算効率が大幅に向上する一方で、ルーティングアルゴリズムの不安定性や、エキスパート間でのバランスの取れた負荷維持の必要性といった課題を抱えています。GB300 NVL72は、このような課題に対し、密結合されたスケールアップおよびスケールアウトネットワーキングによって対応しています。NVLinkがラック内での低レイテンシかつメモリセマンティックな通信を提供し、NVIDIA ConnectX-8 SuperNICsとQuantum-X800 InfiniBandまたはSpectrum-X Ethernetが複数ラック間での予測可能なパフォーマンスを維持します。これにより、大規模なMoEモデルの事前学習におけるボトルネックが解消され、効率的な分散学習が実現されています。
さらに、GB300 NVL72は、GPUあたり288GBのHBM3eメモリを搭載し、ラック全体で21TBのHBM3eをプールすることで、単一のGPUでは保持できない大規模なAIモデルを高速なメモリ階層内に格納できる、前例のない容量を提供します。この統合されたメモリプールは、72基のカードが1つの大きなメモリ空間として機能することを可能にし、MoEモデルにおいて異なるエキスパートがトークンごとにアクティブ化される際に発生する通信レイテンシを大幅に削減します。
開発者・エンジニア視点での考察
-
MoEモデル開発におけるスケーラビリティの再定義: GB300 NVL72の記録的な性能は、大規模MoEモデルの事前学習におけるスケーラビリティの限界を大きく押し上げます。開発者は、これまでハードウェアの制約により断念していた、より大規模で複雑なMoEアーキテクチャの探索に注力できるようになります。特に、ラック・スケールでのシームレスなメモリプールと高速NVLink接続により、モデルのシャーディングやエキスパートの配置戦略において、通信オーバーヘッドを最小限に抑える設計がこれまで以上に重要となるでしょう。
-
ソフトウェアスタックの最適化の重要性: NVIDIA Megatron Coreのようなソフトウェアフレームワークが、GB300 NVL72の性能を最大限に引き出す上で極めて重要な役割を果たしています。これは、最新のハードウェアを導入するだけでなく、分散学習、メモリ管理、通信の最適化といったソフトウェアレベルでの継続的な取り組みが、AIモデルの学習効率に直結することを示唆しています。開発者は、低レベルのハードウェア機能を活用するためのフレームワークやライブラリに習熟し、カスタム最適化の可能性を常に検討する必要があります。
-
効率的なリソース利用のためのアーキテクチャ理解: MoEモデルは、一部のエキスパートが過度に利用されたり、負荷が不均衡になったりする課題を抱えており、これらを克服するためのロードバランシング戦略が不可欠です。GB300 NVL72のようなシステムでは、高価なハードウェアリソースを最大限に活用するため、MoEのルーティングメカニズムやエキスパートの割り当て、そしてそれらが全体的なシステムパフォーマンスにどのように影響するかを深く理解することが求められます。これにより、計算リソースの無駄をなくし、より迅速なモデル反復と実験が可能になります。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


