MetaRoCE: AI規模イーサネット向けの新RDMAトランスポート


ADVERTISEMENT

AI時代の大規模ネットワーク課題とRoCEの限界

今日の最先端AIモデルのトレーニングと提供は、GPU間でデータを高速かつ確実に移動させ、計算サイクルを無駄にしないネットワークに依存しています。Metaは、数十万のGPUが複数のデータセンターと地域に分散するAIクラスタの規模に対応するため、ネットワークが極めて重要なパスになっていると指摘しています。特に、オールリデュースやオールトゥオールといった集合演算は、トレーニング中に数千ものアクセラレータを同期させ、最も遅い転送がジョブ全体のペースを決定します。推論においても、分散されたモデルシャード間の低レイテンシー通信は、数億人ものユーザーに対する応答時間に直接影響を与えます。

従来のRDMA over Converged Ethernet (RoCE) は、ロスレスネットワークを前提とし、パケットの順序通りの配信を期待するため、PFC (Priority Flow Control) を活用していました。しかし、これはマルチプレーンや大規模ネットワークで性能を提供するパケットスプレーを阻害する可能性があります。AIワークロードは、同期されたトラフィックパターンと大規模な「エレファントフロー」を生成する独自の性質を持ち、従来のRoCEv2の実装では、テールレイテンシーの増大、輻輳、パケットロスなどの課題に直面しやすくなります。わずかなパケット遅延(高テールレイテンシー)であっても、クラスタ全体が停止し、数千のGPUがアイドル状態になることで、ジョブ完了時間(JCT)が大幅に増加する問題が顕在化していました。

MetaRoCEのアーキテクチャと革新

このようなAI規模のイーサネットにおける課題に対応するため、Metaは「MetaRoCE」という全く新しいRDMAトランスポートプロトコルを開発しました。MetaRoCEは、汎用イーサネット上でAIワークロード向けにゼロから設計されたもので、その最大の革新は、イーサネットを「本質的にロスがある」ものとして扱い、ネットワークのインテリジェンスの全てをNIC (Network Interface Card) にプッシュすることにあります。

MetaRoCEの主要なアーキテクチャ的特徴は以下の通りです:

  • マルチパス (Multipath): 単一の接続が複数のネットワークパスに分散してトラフィックを転送し、輻輳や障害発生時にも経路を動的に切り替えます。
  • アウトオブオーダー (Out-of-order): パケットの順序が保証されない環境でも効率的に動作し、従来のRDMAにおける順序保証の制約を克服します。
  • レシーバードリブン (Receiver-driven): 受信側がトラフィックフローを制御することで、ネットワークの状態に合わせた柔軟な調整を可能にします。

この「インテリジェンスをエッジ(NIC)にシフトする」アプローチにより、トランスポート層がネットワークトポロジーから分離され、TCO (総所有コスト) を最適化したマルチプレーンFPF (Fabric-Path-First) トポロジーにおいて、アプリケーション導入時の摩擦を大幅に低減します。結果として、MetaRoCEは、アクセラレータの数と距離が増大するネットワークにおいて、高スループット、低テールレイテンシー、そして運用の簡素化を実現するように構築されています。Metaは、MetaRoCEの仕様、リファレンスソフトウェア実装、およびコンプライアンステストスイートをOpen Compute Project (OCP) を通じて公開しており、より広範な業界での採用と発展を促しています。

パフォーマンスと業界への影響

MetaRoCEは、数百万GPU規模での運用を想定して設計されており、実際にMetaの内部で数十万GPU規模のクラスタで運用されています。この新しいプロトコルは、AIトレーニングジョブが以前であれば中断されていた多くのネットワーク障害を乗り越えることを可能にし、回復力の向上に貢献しています。

Metaは、AIインフラにおけるイーサネットの活用を強力に推進しており、MetaRoCEはその戦略の中核をなすものです。MetaRoCEがAMDのプログラマブルNICに実装され、リファレンスソフトウェア実装を通じてそのアーキテクチャがクラスタ内およびファブリック間でどのようにスケーリングされるかが示されています。この動きは、AIワークロードの要求を満たすために、RDMAトランスポートプロトコルが進化する必要があるという業界の幅広い認識と一致しています。

MetaRoCEのオープンスタンダード化への取り組みは、業界全体での協力と普及を促進するものです。NVIDIAのMultipath Reliable Connection (MRC) やUltra Ethernet Consortium (UEC) の取り組みなど、他の企業もAI向けイーサネットベースのRDMAプロトコル開発を進めており、今後もAI規模のネットワーク向けに特化したトランスポートプロトコルの多様化が進むと予想されます。

開発者・エンジニア視点での考察

  1. NICインテリジェンスとソフトウェア定義ネットワーキングの重要性: MetaRoCEがネットワークのインテリジェンスをNICに移行させることで、AIワークロードの多様な要求に動的に適応できるようになった点は、ソフトウェア定義ネットワーキング (SDN) の進化と密接に関連しています。これにより、開発者は基盤となるネットワークトポロジーに縛られることなく、より複雑で大規模な分散AIシステムを設計・展開するための柔軟性を得られます。特に、プログラマブルNICの活用は、将来的なプロトコル改善や特定のAIモデルに最適化された通信パターンの実装を可能にし、ハードウェア更新サイクルに依存しない迅速なイノベーションを促進します。

  2. マルチパス通信と耐障害性の向上: MetaRoCEのマルチパスおよびアウトオブオーダー配信の特性は、大規模AIクラスタにおける耐障害性とスループットの劇的な向上を意味します。これは、従来のRDMAが単一パスに依存し、パケットの順序性を厳格に要求するために、わずかなパケットロスや輻輳が全体のパフォーマンスを著しく低下させる問題(テールレイテンシー)を解決します。AI開発者は、ネットワークのボトルネックや一時的な障害を過度に懸念することなく、より大規模なモデル学習や推論を安心して実行できるようになり、MTPF (Mean Time To Production Failure) の改善に直接貢献します。

  3. オープンスタンダードとエコシステムへの貢献: MetaがMetaRoCEの仕様、リファレンス実装、およびコンプライアンススイートをOpen Compute Project (OCP) を通じて公開することは、AIネットワーキングの分野におけるオープンイノベーションを加速させます。これにより、さまざまなベンダーがMetaRoCEを採用・実装しやすくなり、互換性のあるハードウェアやソフトウェアのエコシステムが拡大します。開発者は、独自のAIインフラを構築する際に、単一ベンダーのソリューションに縛られることなく、高性能かつコスト効率の良い選択肢を検討できるようになります。これは、特定のハードウェアに依存しない汎用的なAIインフラストラクチャの実現に向けた重要な一歩です。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT