OpenAI、自社製AI推論チップ「Jalapeño」の初ベンチマークで圧倒的な性能を公開
「Jalapeño」が示すAI推論性能の飛躍的進歩
OpenAIは、同社初のカスタムAI推論チップ「Jalapeño」の初期性能結果を発表し、AI推論において業界をリードする速度と効率性を達成したことを明らかにしました。この発表は、スループットとレイテンシの間でこれまでトレードオフとされてきた常識を覆すものであり、今日の主要な商用AIハードウェアと比較して、電力効率と処理時間において大幅な向上を実現しています。
「Jalapeño」は、SemiAnalysisが提供する公開ベンチマーク「InferenceX」を用いて評価され、GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1Tの3つのモデルで比較システムを凌駕する性能を示しました。具体的には、ピークスループット時のAIワークロード処理能力がワットあたり1.5倍から1.9倍向上し、エンドツーエンドのレイテンシは1.7倍から3.6倍低減されています。特に、高度にインタラクティブなワークロードでは、2.1倍から4.1倍高いパフォーマンスを発揮しています。 テストされた最大の公開モデルであるKimi K2.5 1Tでは、ピーク性能がワットあたり約1.5倍向上し、エンドツーエンドのレイテンシは3.4倍低減されました。 「Jalapeño」は、NVIDIAのGB300に対し、電力あたりのAIワーク量と応答速度で優れていることが示されており、既存の商用AIシステムに対する明確な優位性が確認されています。 また、Jalapeñoの性能優位性は、OpenAIの内部フロンティアモデルにおいてさらに拡大することが示唆されており、ワークロードが大規模になるほどアーキテクチャがより効果的になることを示しています。
革新を支える技術的深層:AI駆動型チップ設計とアーキテクチャ
「Jalapeño」の卓越した性能は、その革新的な設計とアーキテクチャに由来しています。このカスタムASIC(特定用途向け集積回路)は、TSMCの3nmプロセスノードで製造されており、現代のLLM(大規模言語モデル)推論のためにゼロから設計されました。 特筆すべきは、初期設計からテープアウトまでわずか9ヶ月という異例の短期間で開発されたことです。これは、OpenAI自身のAIモデル(例えばCodex with GPT-Astra)がチップの設計と最適化プロセスを大幅に加速した結果であり、AIがAIハードウェア設計を促進する新たな可能性を示しています。
アーキテクチャ面では、「Jalapeño」はデータ移動を最小限に抑え、演算、メモリ、ネットワークリソースのバランスを最適化することで、理論上のピーク性能に限りなく近い実効利用率を達成しています。 これは、フロンティアAIモデルにとって最も重要なカーネル、メモリ移動、ネットワーキング、およびサービングパターンに焦点を当てて最適化された結果です。 MatrixエンジンはMXFP数値形式と、TPUに類似した重み静的のシストリックアレイを採用しており、これは汎用GPUとは異なるLLM推論に特化した設計アプローチを反映しています。 また、「Jalapeño」は単一トークン予測(STP)において、推測デコーディングやプリフィル・デコード分離なしで、DeepSeek R1モデルで並行度1において1秒あたり700トークン以上という優れたインタラクティブ性能を発揮します。 定格電力は700Wですが、テスト中の持続消費電力は550W以下に抑えられています。
フルスタック最適化戦略と将来展望
「Jalapeño」の開発は、OpenAIの長期的なフルスタックインフラストラクチャ戦略の重要な一環です。この戦略は、データセンターとチップ、フロンティアモデル、開発者プラットフォーム、コンシューマーおよびエンタープライズ製品、AIネイティブデバイスにわたる統合システムを通じて、各層が互いを強化し合うことを目指しています。 自社でチップを設計することで、OpenAIはモデルの実行方法とサービス提供の経済性をより詳細に制御できるようになり、結果としてAIをより手頃な価格で、より広範に利用可能にすることを目指しています。
OpenAIは、「Jalapeño」を2026年末までに自社のコンピューティングインフラストラクチャに展開し始める計画です。 これは多世代にわたるプラットフォームの第一歩であり、第2世代は開発が進行中、第3世代も構想されていることが明らかにされています。 同社は、「Jalapeño」を導入する一方で、NVIDIAやその他のパートナーからのアクセラレーターも、トレーニングと推論の両方のワークロードで引き続き展開していく方針です。 この戦略は、特定のワークロードに対して最適なシステムを選択し、適切な経済性で提供するための柔軟性をOpenAIに与えるものです。
開発者・エンジニア視点での考察
-
推論コストとレイテンシの劇的な改善: 「Jalapeño」が実現するワットあたりのAIワーク処理能力の向上と低レイテンシは、開発者がこれまで既存の商用ハードウェアでは困難であった、低コストかつ超低レイテンシのAIアプリケーションを構築する道を開きます。これにより、リアルタイム対話エージェント、高度な自然言語処理、複雑なマルチステップ推論ワークフローなど、インタラクティブ性が重視されるAI製品において、ユーザー体験が飛躍的に向上する可能性があり、新たなアプリケーション領域が創出されるでしょう。
-
AIによるAIハードウェア設計の加速: OpenAIが自社製AIモデルを用いて「Jalapeño」をわずか9ヶ月で設計・テープアウトしたという事実は、今後のカスタムAIチップ開発におけるAI活用パスの強力な証明となります。これは、特定のワークロードに最適化された専用ハードウェアの市場投入サイクルが劇的に短縮されることを示唆しており、ハードウェアとソフトウェアの協調設計がAI時代におけるイノベーションの主要なドライバーとなることを意味します。開発者は、将来的にAI駆動型ツールを活用したハードウェア・ソフトウェアの共同最適化を視野に入れる必要があります。
-
フルスタックアプローチによる新たな最適化機会: OpenAIのフルスタック戦略は、モデル、ソフトウェア、チップ、メモリ、ネットワークの各層が連携して最適化されることで、システム全体としての性能を最大化する可能性を示しています。これは、開発者がアプリケーションを設計する際に、単一コンポーネントの性能だけでなく、基盤となるハードウェアからモデル、そしてサービス提供スタック全体にわたる最適化の機会を考慮する必要があることを意味します。より効率的なモデルのデプロイメントと管理のためには、この統合されたシステムアプローチへの理解と適応が不可欠となるでしょう。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


