NVIDIA Vera CPU:OlympusコアによるエージェントAI向けシングルスレッド性能の最大化
NVIDIA Vera CPUの概要とエージェントAI向け設計思想
NVIDIAは、特に「エージェントAI」および強化学習(RL)ワークロード向けに設計された次世代データセンターCPU、「NVIDIA Vera」を発表しました。Vera CPUは、従来のデータセンターCPUがコア密度とスループットを優先するのに対し、エージェントAIの特性であるシングルスレッド性能、低メモリレイテンシ、効率的なデータ移動に焦点を当てて最適化されています。エージェントAIは、コード実行、ツール利用、サンドボックス化、分析、データパイプライン、オーケストレーションといった、GPU推論の間にCPUが担うクリティカルな処理パスを多用します。これらの「エージェントループ」は継続的に実行され、各エージェントの応答性とAIファクトリ全体の処理能力に直接影響を与えるため、CPUの性能がボトルネックとなることが指摘されていました。Vera CPUの中核をなすのは、カスタムArmv9.2ベースの「Olympus」コアであり、これらのCPU集約型タスクを高速化することで、GPUへのデータ供給を維持し、エージェントの応答性を高め、トレーニングループを円滑に進めることを目的としています。
Olympusコアアーキテクチャの詳細と性能強化
Olympusコアは、エージェントAIワークロードの「不規則で分岐が多く、レイテンシに敏感な」ソフトウェアパスにおいて、サイクルあたりの命令数(IPC)を最大化するためにゼロから設計されました。この目標達成のため、Olympusコアは以下の主要なアーキテクチャ要素を備えています。
- ワイドなフロントエンド: 最大16命令を毎サイクルフェッチし、10-wideデコーダが毎サイクル最大10個のフューズされた命令を処理できます。
- ニューラル分岐予測器: 誤ったパスの実行を削減し、毎サイクル最大2つの分岐を解決することで、制御フローの変更が多いエージェントワークロードの効率を大幅に向上させます。
- ディープなアウトオブオーダー実行: 命令レベルの並列性を最大限に活用し、CPUの実行ユニットを常に飽和状態に保ちます。
- 最適化されたキャッシュサブシステム: 64KBのL1命令キャッシュ、96KBのL1データキャッシュ、2MBのL2キャッシュ、およびモノリシックコンピュートダイ上に統合された164MBのL3キャッシュを搭載し、高速なデータアクセスを提供します。
- Spatial Multithreading (SMT-X): 従来の同時マルチスレッディングとは異なり、Olympusコアあたり2つのハードウェアスレッドを、コアリソースを物理的に分割することで提供します。これにより、スレッド間の競合を削減し、予測可能なスループットを維持しながら、マルチテナントAIファクトリ環境で必要な強力なスレッド分離を実現します。
これらのアーキテクチャ革新により、OlympusコアはNVIDIA Graceと比較してIPCで50%の向上を達成し、エージェントの各ステップをより迅速に完了させることが可能となります。
革新的なメモリサブシステムとコヒーレンシファブリック
NVIDIA Vera CPUは、エージェントAIワークロードに不可欠な高帯域幅と低レイテンシを実現するために、革新的なメモリサブシステムとコヒーレンシファブリックを統合しています。
- SOCAMM2 LPDDR5Xメモリ: 最大1.2 TB/sの総メモリ帯域幅と、コアあたり最大14 GB/sの帯域幅を提供します。 これは従来のDDR5およびMRDIMMベースのサーバー設計と比較して、大幅に低いメモリ消費電力で同等の帯域幅を実現し、システム全体の消費電力を削減しながら、コアがデータ不足に陥るのを防ぎます。 また、最大1.5TBのメモリ容量をサポートし、大容量のワーキングセットを持つワークロードに対応します。
- Scalable Coherency Fabric (SCF): 第2世代のSCFは、オンダイで最大3.4 TB/sのコア間帯域幅を提供し、低レイテンシのCPUクラスタ間通信、共有システムレベルキャッシュへの効率的なアクセス、メモリコントローラへの高帯域幅接続を実現します。
- 高速インターコネクト: NVLink-C2Cインターフェースは最大1.8 TB/sのコヒーレントなCPU-GPU帯域幅を提供し、PCIe Gen 6とCXL 3.1もサポートすることで、GPUやその他のアクセラレータとの高速なデータ転送を可能にします。 デュアルソケットシステムでは、176レーンのPCIe Gen 6を提供し、大規模な拡張性にも対応します。
これらの技術は、エージェントAI、強化学習、グラフ分析、データ処理といった、大量のデータと不規則なアクセスパターンに依存するワークロードにおいて、バランスの取れた高性能プラットフォームを提供します。
エージェントAIファクトリにおけるVera CPUの価値と性能指標
NVIDIA Vera CPUは、エージェントAIファクトリのスループット、応答性、GPU効率を最大化する上で重要な役割を果たすと期待されています。NVIDIAの内部テストによると、Vera CPUは特定のagentワークロードにおいて、従来のx86システムと比較して最大1.8倍の性能向上を実現しています。 また、サンドボックス環境の性能では最大80%の高速化を達成しています。
さらに、フルソケット負荷時においても、従来のCPUと比較してコアあたり最大1.8倍の持続的な性能向上、ピーク負荷時のレイテンシを40%削減、そしてコアあたり3倍以上のメモリ帯域幅を半分の消費電力で提供します。 パートナー企業による測定では、Starburstによる大規模SQL分析で3倍の高速化、Redpandaによるリアルタイムストリーミングで最大6倍の低レイテンシが報告されており、Vera CPUが様々なAI関連ワークロードで高い性能を発揮することが示されています。 このような性能向上は、CPU側でのツール実行やコード実行、データ処理といったステップを高速化し、GPUが待機する時間を短縮することで、GPUの効率を直接的に向上させ、AIファクトリ全体でのトークン生成量を最大化します。
開発者・エンジニア視点での考察
-
エージェントのシングルスレッド性能最適化の重要性: Vera CPUがシングルスレッド性能を最大限に引き出す設計であることから、エージェントAIのコアとなる「エージェントループ」内のコードは、レイテンシを最小化し、制御フローを最適化し、分岐予測ミスを減らすよう重点的に開発する必要があります。特に、ツール呼び出し、コード実行、評価ループなど、シーケンシャルな性質を持つ処理において、IPCを向上させるための低レベルな最適化が全体のAIファクトリスループットに直接寄与します。
-
Spatial Multithreading (SMT-X)を活用した堅牢なマルチテナンシー: SMT-Xによるリソースの物理的分割は、従来のSMTと比較してスレッド間の強力な分離を提供します。これにより、複数のエージェントサンドボックスを単一ソケット上で効率的かつ予測可能な性能で同時に実行するマルチテナントAI環境において、より安定したパフォーマンスとセキュリティを期待できます。開発者はこの特性を活かし、リソース競合を最小限に抑えつつ、多数のエージェントをスケールアウトさせるアーキテクチャ設計を検討すべきです。
-
メモリ集約型ワークロードへの適応: Vera CPUの高速なLPDDR5Xメモリと高いコアあたりメモリ帯域幅は、グラフ分析、データベースクエリ、大規模なコンテキストを持つエージェントタスクなど、大きなワーキングセットと不規則なアクセスパターンを持つアプリケーションにとって非常に有利です。開発者は、データ局所性を考慮し、効率的なメモリアクセスパターンを設計することで、これらのメモリ集約型ワークロードのボトルネックを解消し、Vera CPUの潜在能力を最大限に引き出すことができます。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


