NVIDIA Rubin GPUアーキテクチャ詳解:エージェントAI時代の推進力


ADVERTISEMENT

NVIDIA Rubin GPUアーキテクチャの概要とAgentic AIへの最適化

NVIDIA Rubin GPUは、長期コンテキスト推論、多段階生成、分散MoE (Mixture-of-Experts) デコード、低レイテンシのインタラクションといったエージェントAIワークロードの実行パターンに特化して設計されています。この新アーキテクチャは、既存のBlackwellと比較して、エネルギー単位あたりのエージェント処理スループットを最大10倍向上させることを目指しており、AIファクトリの性能と効率を最大化します。 Rubin GPUは、3360億個のトランジスタで構成され、2つの計算ダイが高帯域幅インターフェース(NV-HBI)によって単一パッケージ上で統合されています。 これにより、224のストリーミングマルチプロセッサ(SM)と896のTensorコアが提供され、エージェントワークロードを効率的に加速します。

Rubinアーキテクチャの核となるのは、Blackwellの次の世代のAIスーパーコンピューティングプラットフォーム「NVIDIA Vera Rubin」の一部としての役割です。 このプラットフォームは、Vera CPU、NVLink 6スイッチ、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 Ethernetといったコンポーネントと統合され、ラック・スケールでのAI処理を最適化します。 特に、第3世代Transformer Engineは、適応型圧縮技術と組み合わされ、NVFP4パフォーマンスにおいて最大50ペタフロップス(スパース)を実現し、精度を維持しながら効率的にエージェントワークロードを加速します。

高性能メモリと革新的な相互接続技術

Rubin GPUは、エージェントAIワークロードにおけるデータ移動のボトルネックを解消するため、革新的なメモリと相互接続技術を導入しています。メモリ面では、HBM4メモリを最大288GB搭載し、最大22TB/sのピーク帯域幅を提供します。 これはBlackwellおよびBlackwell Ultraと比較して2.8倍の増加に相当し、HBM4がHBM3eと比較してインターフェース幅を2倍にしたことによるものです。 この大容量と高帯域幅は、大規模なコンテキストウィンドウ、KVキャッシュ容量、および高い同時実行性をサポートし、不必要なKVキャッシュのオフロードなしにモデルの常駐を可能にします。

相互接続においては、Rubin GPUは第6世代NVLink技術を採用しています。GPU-GPU間のスケーラブルな帯域幅は3,600GB/s(3.6TB/s)に達し、NVLink Switchを介したオールトゥオール通信を実現します。 さらに、NVLink-C2Cは、CPU-GPU間のコヒーレントな通信に1,800GB/sを提供し、x16 PCIe Gen 6はホスト接続に最大256GB/sの帯域幅を提供します。 これらの高速インターフェースは、大規模なMoEモデルにおけるエキスパート重みの効率的な移動や、分散推論ワークロードにおける低レイテンシの同期に不可欠です。

Agentic AIワークロードを加速する主要技術革新

NVIDIA Rubin GPUは、エージェントAI特有の複雑な要件に対応するため、複数の技術革新を導入しています。

  1. 拡張されたTensor Memory Accelerator(TMA):TMAは、エキスパートが豊富なモデルにおけるデータ移動オーバーヘッドを削減するために強化されました。 改善されたディスクリプタ処理により、同じレイアウトを共有しながらメモリ内の異なる場所に存在するテンソルをソフトウェアがより効率的に処理できるようになります。Rubinでは、TMAのインラインディスクリプタ更新がサポートされ、メモリ内でディスクリプタを変更する代わりに、カーネルがTMA命令で直接メモリポインタやストライドなどのフィールドを上書きできるようになり、MoEディスクリプタメタデータの計算を削減し、データ移動の計算オーバーヘッドを軽減します。

  2. カウント済み書き込み(Counted Writes):デバイスが開始するNVLink通信のために導入され、GPU-to-GPUデータ転送の同期を効率化します。 これにより、受信側のGPUが転送完了をより効率的に追跡できるようになり、分散推論ワークロードにおけるレイテンシと相互接続帯域幅の消費を削減します。

  3. Softmaxスループットの向上:Rubinは、Blackwell Ultraと比較してBF16/FP16指数計算を2倍に高速化し、Blackwellと比較してこれらの低精度データタイプで4倍のスループット向上を実現します。 これは、Agentic AIの推論においてボトルネックとなることが多いSoftmax処理の性能を飛躍的に向上させます。

これらの最適化により、Rubin GPUは、大規模なMoEモデルの効率的な処理、長文コンテキストの高速推論、そして多段階の自律的AIエージェントの要求を満たすための基盤を提供します。

開発者・エンジニア視点での考察

  1. MoEモデルの効率的な運用と最適化: Rubin GPUのTMA強化により、Mixture-of-Experts (MoE) モデルにおける専門家重みのデータ移動オーバーヘッドが大幅に削減されます。 これは、開発者がより大規模で複雑なMoEモデルを効率的にデプロイし、実行できることを意味し、マルチエージェントシステムの性能向上に直結します。開発者は、データローディングやメモリ管理の最適化に費やす時間を削減し、モデルのアーキテクチャや推論ロジックの改善に集中できるようになります。

  2. 長文コンテキスト処理と低レイテンシ推論の恩恵: HBM4メモリの大容量化(288GB)と高帯域幅(22TB/s)、そしてNVLink 6によるGPU間通信の高速化(3.6TB/s)は、エージェントAIに不可欠な長文コンテキスト処理と低レイテンシの多段階推論を可能にします。 開発者は、過去の対話履歴や膨大な知識ベースを参照する、より複雑な推論チェーンやリアルタイム応答が求められるアプリケーションを設計する上で、新たな自由度と性能保証を得られます。これにより、より高度で人間らしい対話システムや自律エージェントの開発が促進されます。

  3. ラック・スケールAIファクトリの実現とスケーラビリティ: Rubin GPUがVera Rubinプラットフォームの一部としてラック・スケールで設計されていること(例:Vera Rubin NVL72システムは72基のRubin GPUと36基のVera CPUで構成)は、AI開発者が個々のGPU性能だけでなく、システム全体の電力効率、冷却、ネットワーキングを考慮したスケーラブルなAIインフラを構築する上で重要な意味を持ちます。 これにより、大規模なAIエージェントの展開と運用がより経済的かつ効率的になり、AIサービスの提供におけるコストパフォーマンスと持続可能性が向上します。開発者は、将来的なAIワークロードの拡大を見据えたインフラ設計において、この統合プラットフォームの恩恵を最大限に活用できるでしょう。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT