NVIDIA DSX MaxLPS:AIファクトリーのワットあたり性能を最大化する革新的アプローチ
NVIDIA DSX MaxLPSによるAIファクトリーの変革
NVIDIA DSX MaxLPSは、AIファクトリーにおける電力あたりの論理処理システム(LPS)性能を最大化するために設計された革新的なフレームワークです。これは、施設設計、NVIDIA Dynamic Power Software(DPS)、および高度なワットあたり性能技術を連携させることで、AIファクトリー事業者が固定の電力予算内でスループットとエネルギー効率を最適化することを目的としています。AIファクトリーは、従来のデータセンターがファイルを保存するのに対し、トークンを生成する新しいクラスのインフラストラクチャであり、その経済性は秒間トークン数、ワットあたりトークン数、トークンあたりのコスト、利用率、稼働時間によって定義されます。このような環境において、ワットあたり性能は収益に直結する重要な指標となります。
DSX MaxLPSは、AIファクトリー全体の最適化を可能にし、同一のサイト電力エンベロープ内で最大40%多くのGPUを稼働させることができるとされています。これは、GPUレベルの静的な電力設定であるMaxP(最高電力設定)やMaxQ(ワットあたり最高のアプリケーション性能)を超え、データセンター全体で動的な電力割り当てと、未使用の電力を回収する「ストランデッドパワーリカバリー」を組み合わせることで実現されます。NVIDIA DSXプラットフォームの一部として、MaxLPSはAIモデルの推論とトレーニングの両方において、コストあたりのトークン生成量を最小化し、ワットあたりトークン生成量を最大化することを目指します。
技術的詳細と最適化戦略
DSX MaxLPSは、AIファクトリーのあらゆる層でワットあたり性能を最大化するための複数の技術を統合しています。主要な要素としては、45℃の温水液冷技術と、GPUおよびラック間でのリアルタイムな電力制御(パワーステアリング)が挙げられます。従来の液冷システムが冷水を使用し、エネルギー消費の大きいチラーを必要とするのに対し、45℃の温水液冷はPUE(Power Usage Effectiveness)を向上させ、AIファクトリーの電力のより大部分を収益を生み出す計算に振り向けることができます。
また、DSX MaxLPSは、NVIDIAの広範なソフトウェアスタックとハードウェアのシナジーを最大限に活用します。NVIDIAのGPUアーキテクチャ(Hopper、Blackwell、Vera Rubinなど)は、世代ごとにワットあたりで生成されるインテリジェンスの量を増やすように設計されており、6世代で100万倍の推論スループット向上を達成しています。特に、Blackwell NVL72プラットフォームは、Hopper世代と比較してワットあたり最大25倍の性能向上を実現し、Mixture-of-Experts (MoE) モデルのような最新のAIモデルの効率的な実行に貢献しています。
ソフトウェア面では、NVIDIA Dynamo、TensorRT LLM、SGLang、vLLMなどの推論ソフトウェアスタックが、NVFP4量子化、分散型サービング、大規模エキスパート並列処理、KV対応ルーティング、KVキャッシュオフロードなどの最適化を統合しています。これらの技術は、GPUが提供する性能を何倍にも引き上げ、電力損失を削減することで、AIワークロードの効率を劇的に改善します。DSX MaxLPSは、リアルタイムでGPUとラック間で電力をシフトさせ、電力ステアリングなどの技術を用いて、電力予算内でより多くの性能を引き出すことで、冷却やラックレベルの非効率性によって失われる電力のギャップを埋めます。
開発者・エンジニア視点での考察
-
動的な電力管理によるリソース効率の最大化: DSX MaxLPSは、GPUやラックレベルで電力を動的に再割り当てし、未使用の容量を解放することで、AIファクトリー全体の利用率を最適化します。これは、特に可変性の高いAIワークロードにおいて、固定された電力割り当てによるリソースの「ストランディング(座礁)」を防ぎ、開発者がより多くのGPUリソースを効果的に利用できることを意味します。開発者は、ワークロードの特性に合わせてDSX MaxLPSの設定を調整することで、コストとパフォーマンスのバランスを最適化できるでしょう。
-
フルスタック最適化による性能の最大化と開発サイクル短縮: DSX MaxLPSは、チップ、システム、ソフトウェア、設備インフラに至るフルスタックの共同設計アプローチを採用しています。これにより、モデル開発者は、個々のコンポーネントの最適化だけでなく、インフラストラクチャ全体で最も効率的な実行パスが提供されることを期待できます。これは、開発者がインフラのボトルネックを心配することなく、モデルのイノベーションと高速なデプロイに集中できる環境を構築し、AI開発サイクル全体の短縮に貢献します。
-
液体冷却と電力効率技術の活用による持続可能なAI開発: 45℃液冷や電力ステアリングといった先進的な電力効率化技術は、AIファクトリーのPUEを向上させ、運用コストを削減するだけでなく、AI開発の持続可能性を高めます。開発者は、これらの技術を活用することで、より大規模なモデルのトレーニングや推論を、環境負荷を低減しつつ実施することが可能になります。これにより、開発者は持続可能なAIソリューションの設計と実装を積極的に検討するインセンティブを得られます。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


