Meta、LLMスケール広告基盤モデルGEMの学習効率を2倍に向上させる技術を発表
GEMのアーキテクチャと大規模学習の課題
Metaは、InstagramやFacebookの広告推薦を支える基盤モデル「Generative Ads Recommendation Model (GEM)」の学習効率を劇的に向上させました。GEMは、LLM(大規模言語モデル)のスケールで、数千に及ぶ最新世代のGPUを利用して学習されており、その訓練には従来のLLMワークロードとは異なる、推薦システム特有のデータ特性を持つハイブリッドアーキテクチャが組み合わされています。このモデルは、広告コンテンツとユーザーエンゲージメントデータ(広告とオーガニックインタラクションの両方)に基づいて学習され、シーケンス特徴と非シーケンス特徴の両方を活用します。
GEMの学習は、既存のLLM学習向けに最適化されたAIインフラ(カーネル、並列処理、低精度レシピなど)が直接適用できないという独自のエンジニアリング課題を提示しました。そのため、効率的な推薦モデル向けLLMスケール学習を実現するためには、大幅なイノベーションとハードウェア/ソフトウェアの共同設計が必要でした。これにより、過去12ヶ月間でエンドツーエンド(E2E)の学習効率を20〜25%のModel FLOPs Utilization (MFU) に倍増させつつ、総学習FLOPsを4倍にスケールさせることに成功しました。
エンドツーエンド効率の倍増を可能にした技術革新
Metaは、GEMの学習効率を向上させるために、計算効率とスケーリング効率の両面で革新的なアプローチを採用しました。
計算効率の最適化:
- カスタム推薦カーネルライブラリ: Jagged Flash Attention (JFA)、Generalized Dot-Product Attention (GDPA)、BlockAttentionなどのカスタムカーネルライブラリを開発し、推薦ワークロードに最適化しました。
- 超低精度学習の採用: MXFP8アテンションやMLPを含む混合超低精度学習を導入し、最新世代GPUのアーキテクチャを最大限に活用するように設計されています。
- トレーニングスタックの再構築: 全体的なトレーニングスタックを再構築し、16倍のGPUを使用しながらも実効トレーニングFLOPsを23倍に増加させ、MFUを1.43倍向上させました。ジョブ起動時間は5倍、PyTorchコンパイル時間は7倍短縮されています。
スケーリング効率の最適化:
- トポロジーを考慮した5D並列処理: Metaの多層ネットワーク階層と共同で設計された、トポロジーを考慮した5D並列処理を採用しました。これには、密なパラメーターに対する2D FSDPとエキスパート並列処理、疎なパラメーターに対するFully Sharded 2D Model Parallelismが含まれ、通信オーバーヘッドを削減します。
- GPUクラスターの拡張: 2025年第4四半期にはGEMの学習に使用されるGPUクラスターを倍増させ、2026年にはさらに大規模なクラスターへのスケールアップ、モデルの複雑性向上、学習データ拡張、新しいシーケンス学習アーキテクチャの導入を計画しています。
これらの技術革新により、GEMはLLMと同様の効率でスケーリング可能な推薦モデルアーキテクチャを実現し、データと計算量に対して費用対効果の高いパフォーマンス向上をもたらしています。
知識転移と広告エコシステムへの影響
GEMは、Metaの広告推薦システムにパラダイムシフトをもたらしています。その知識は、何百ものユーザー向け垂直モデルに効率的に転送されるように設計されています。この知識転移には、以下の2つの主要な戦略が用いられています。
- 直接転移 (Direct transfer): GEMが学習されたデータ空間と同じ主要な垂直モデルに知識を直接転送します。
- 階層的転移 (Hierarchical transfer): GEMからドメイン固有の基盤モデルに知識を蒸留し、その後これらの基盤モデルが垂直モデルを学習させます。
これらのアプローチは、知識蒸留、表現学習、パラメーター共有といった技術を組み合わせることで、Metaの広告モデルエコシステム全体での転送効率を最大化しています。特に、GEMは、その推論プロセスをより小さく、高速なモデルが模倣できるようにする「Student Adapter」を活用しており、これにより計算コストを継承することなくGEMのインテリジェンスを享受できます。
GEMの導入により、2025年第2四半期にはInstagramの広告コンバージョン率が5%増加し、Facebookフィードのパフォーマンスが3%向上したと報告されています。2025年第4四半期には、Facebookでのクリック数が3.5%増加、Instagramでのコンバージョンが1%以上増加しました。これは、個々の広告インプレッションのパフォーマンスを最大化することで、広告主にとっての投資収益率(ROI)向上と広告パフォーマンスの改善に貢献しています。
開発者・エンジニア視点での考察
-
特化型LLMスケールモデルにおけるハードウェア/ソフトウェア共同設計の重要性: GEMの事例は、LLMスケールでの推薦システムのように、特定のドメインとデータ特性を持つ大規模モデルを訓練する際には、汎用的なLLM向け最適化だけでは不十分であることを示しています。GPUカーネル、低精度計算、並列処理戦略、ネットワーク、メモリ管理といったインフラストラクチャ全体をモデルアーキテクチャと密接に共同設計することが、効率を最大化し、独自の課題を克服するための鍵となります。これは、今後多様なドメイン特化型大規模基盤モデルが登場するにつれて、より一層重要なアプローチとなるでしょう。
-
推薦システム特有のデータ特性に対応する並列化・最適化戦略: 推薦システムは、疎な特徴量や高次元の埋め込み表現を多用するため、一般的な言語モデルとは異なるメモリアクセスパターンや計算特性を持ちます。GEMが採用した「Topology-aware 5D parallelism」や「カスタム推薦カーネルライブラリ」は、FSDPとエキスパート並列処理を組み合わせつつ、疎なパラメーターに対する特化した並列化手法を用いることで、これらの特性に対応し、LLMスケールでの効率的な訓練を可能にしました。これは、推薦システム開発者が大規模モデルを設計する際に、データ構造に応じた並列化戦略を深く検討する必要があることを示唆しています。
-
基盤モデルからの知識転移における多様な戦略の確立: GEMは、その膨大な知識を、本番環境で実際に広告を配信する数百ものより小規模な垂直モデルに効率的に転移させるために、直接転移、階層的転移、Student Adapter、表現学習といった多角的なアプローチを採用しています。特に、Teacher-Studentアーキテクチャを通じて、基盤モデルの計算コストを直接継承することなくそのインテリジェンスを活用する戦略は、大規模基盤モデルの実世界への展開における汎用的な課題解決策として非常に参考になります。開発者は、基盤モデルの訓練だけでなく、その知識をいかに効率的に「民主化」し、ダウンストリームタスクに活用するかというデプロイメント戦略も初期段階から考慮する必要があります。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


