NVIDIA GB300 NVL72における2.4兆パラメータモデルQwen3.8-2.4T-A95Bの推論と設定可能な推論能力


ADVERTISEMENT

大規模MoEモデル「Qwen3.8-2.4T-A95B」のアーキテクチャと要求性能

Alibabaは、フロンティアに近い能力をオープンエコシステムにもたらす、最大規模のオープンウェイトモデルであるQwen3.8-2.4T-A95B (Qwen3.8-Max) のオープンウェイトをリリースしました。このモデルは、合計2.4兆のパラメータを持ち、トークンごとに950億のパラメータがアクティブ化されるという特徴があります。Qwen3.8-2.4T-A95Bは、フルアテンションとリニアアテンションのハイブリッドな機構を持つ、きめ細かいMixture-of-Experts (MoE) アーキテクチャを採用しています。最大100万トークンのコンテキストウィンドウと最大128Kの出力長を持ち、要求の厳しい推論およびエージェントワークロード向けに設計されています。

このような2.4兆パラメータもの大規模オープンウェイトモデルを展開するには、データセンタースケールの高速計算能力が必要不可欠です。この規模での推論は、チップ、システムアーキテクチャ、およびソフトウェアにおける極めて綿密なコデザインに依存します。コンテキストが拡大するにつれて、アテンション、計算、およびKVキャッシュメモリが性能の制約要因となります。Qwen3.8-2.4T-A95Bのフルアテンションとリニアアテンションのハイブリッドアーキテクチャは、この課題に対処するために設計されており、モデルはこれら2つのアテンションメカニズムを交互に切り替えて利用します。

NVIDIA GB300 NVL72によるエクストリームインファレンス実現

NVIDIAは、Qwen3.8-2.4T-A95Bのような大規模モデルのマルチノード展開を、最適化されたカーネル、推論ランタイム、および分散サービングレシピを通じてオープンソースエコシステムと協力して推進しています。特に、NVIDIA GB300 NVL72システムは、この種の超大規模AIモデルの推論を可能にするために設計された、最先端のインフラストラクチャです。

GB300 NVL72は、72基のNVIDIA Blackwell Ultra GPUと36基のNVIDIA Grace CPUをラック構成で搭載し、130 TB/sのNVLink帯域幅と37 TBの高速メモリで接続されています。これにより、ラックあたり最大1,440 PFLOPSのFP4 Tensor Core性能を提供します。Day 0の時点では、追加のモデルチューニングなしで、GB300 NVL72上でのFP8精度において、GPUあたり毎秒4Kトークン以上、ユーザーあたり毎秒350トークン以上のスループットを達成しています。NVFP4精度を含むさらなる最適化により、時間の経過とともに強化された性能向上が期待されています。

このプラットフォームは、リアルタイムビデオ分析、ドメインチューニングされたマルチモーダルRAG、高忠実度画像・動画生成など、次世代のマルチモーダルAIワークロードに特化して設計されており、Hopper世代と比較して大幅なAI性能向上を実現します。GB300 NVL72は、NVIDIA TensorRT-LLMやTriton Inference Serverといったソフトウェアスタックと連携し、大規模かつ複雑なAIモデルの効率的な運用を可能にします。

設定可能な推論とエージェントワークロードへの対応

Qwen3.8-2.4T-A95Bは、コーディング、大規模文書分析、長時間にわたる多段階ワークフローといった、最も困難なエージェントワークロード向けに構築されています。単一のプロンプトを送信して単一の応答を受け取るチャットファーストモデルとは異なり、エージェントアプリケーションは、システム指示、ツール出力、検索された文書、コード、ログ、および多段階の推論トレースをワークフロー全体で蓄積します。これは、「設定可能な推論(Configurable Reasoning)」と呼ばれる機能の中核をなすもので、モデルが動的に推論戦略を調整し、複雑なタスクに対応できることを意味します。

長文コンテキスト処理におけるアーキテクチャ革新は、エージェントAIにとって極めて重要です。フルアテンション層では、すべてのトークンが他のすべてのトークンにアテンションを払いますが、リニアアテンション層では、増大するKVキャッシュが効率的な表現に置き換えられます。これにより、エージェントが長期的な記憶と複数のステップにわたる計画を維持しながら、より複雑な問題解決を行うことが可能になります。NVIDIA GB300 NVL72のような基盤となるインフラストラクチャは、このようなエージェントモデルが要求する、爆発的に増大する計算とメモリの要求に対応するための鍵となります。

開発者・エンジニア視点での考察

  1. モデルの選択とハードウェア要件の深い理解: 2.4兆パラメータのような大規模MoEモデルを効率的に運用するためには、単一GPUの性能だけでなく、ノード間およびラック間接続の広帯域幅、総メモリ容量と帯域幅、そしてNVIDIA TensorRT-LLMやTriton Inference Serverを含む最適化されたソフトウェアスタックといった、システム全体のコデザインが不可欠です。開発者は、モデル選択時において、その計算要件と利用可能なインフラストラクチャの適合性を深く評価し、ボトルネックを特定する能力が求められます。

  2. エージェントAI開発における長文コンテキスト処理の設計戦略: Qwen3.8-2.4T-A95Bのハイブリッドアテンションや100万トークンコンテキストサポートは、単一のプロンプト応答を超え、ツール利用、文書分析、多段階推論といった複雑なエージェントワークロードにおいて、一貫した情報保持と深い推論を可能にします。開発者は、エージェントの設計において、長文コンテキストを前提とした状態管理、情報検索、および推論戦略を考慮し、モデルが持つ潜在能力を最大限に引き出すアーキテクチャを構築する必要があります。

  3. FP8/NVFP4精度導入がもたらすパフォーマンスと開発ワークフローへの影響: FP8精度での高スループット達成は、推論コスト削減と応答速度向上に直結し、より広範なアプリケーションでの大規模モデル利用を促進します。将来的なNVFP4の導入はさらなる性能向上をもたらす一方で、量子化によるモデルの頑健性や精度への影響を評価し、必要に応じて量子化対応トレーニングやファインチューニングのワークフローを開発プロセスに組み込む必要が生じます。精度と性能のトレードオフを理解し、ターゲットとするアプリケーション要件に合わせて適切な精度を選択・調整するスキルが重要になります。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT