NVIDIA AI、エージェントAIの効率とスケーラビリティを革新するNemotron 3.5 LightningとNeMo Switchyardを発表
NVIDIA AIは、常に稼働するAIエージェントの構築を最適化するため、軽量かつ高効率なオープンモデル「Nemotron 3.5 Lightning」と、エージェントワークフローを効率的にルーティングするオープンソースライブラリ「NeMo Switchyard」をリリースしました。これらの技術は、複雑なマルチエージェントシステムにおけるパフォーマンス、コスト効率、および制御の向上を目的としています。
Nemotron 3.5 Lightning:高性能と効率を両立したエージェントAIモデル
Nemotron 3.5 Lightningは、300億の総パラメータを持つ混合エキスパート (MoE) モデルでありながら、アクティブパラメータは30億に抑えられています。このモデルは、Mamba-2、MoE、Attentionを組み合わせたハイブリッドアーキテクチャを採用し、100万トークンという広範なコンテキストウィンドウを特徴としています。この設計により、Nemotron 3.5 Lightningは、同様のサイズを持つ他のモデルと比較して最大4倍の高速な出力速度を実現し、10,000のPinchBenchタスクをQwen3.6 35Bと同等の精度で30%高速に完了できるとNVIDIAは報告しています。
Nemotron 3.5 Lightningの主な目的は、高頻度のエージェントタスクに特化することです。例えば、ツール呼び出し、結果検証、サブエージェント委譲、コードレビュー、ログトリアージ、契約解析、長文コンテキスト検索、セキュリティアラート監視、請求に関する質問応答など、多岐にわたる専門的なワークロードに対応可能です。
デプロイメントの面では、このモデルは驚くべき柔軟性を提供します。1台のDGX Spark (GB10) または1台のH100 GPUといった単一の最新GPU上で展開可能であり、Blackwell、Hopper、Ampereアーキテクチャをサポートします。また、OpenMDW-1.1ライセンスの下でオープンウェイト、トレーニングデータ、およびレシピが提供され、商用利用にも対応しています。NVFP4チェックポイントもBF16と並行して提供され、様々なハードウェアでの効率的な推論を可能にします。
NeMo Switchyard:スマートルーティングによるAIエージェントの最適化
NeMo Switchyardは、AIエージェントツール内でインテリジェントなルーティングを実現するためのオープンソースライブラリです。その役割は、エージェントワークフローの各ステップを、そのタスクにとって最も能力が高く、かつ効率的なモデルに指示することにあります。これにより、常に最先端の推論モデルを使用することなく、コストとレイテンシを大幅に削減することが可能になります。
Switchyardの核心的なメカニズムは「エスカレーションルーター」です。このルーターは、セッションをより安価なモデルで開始し、LLMジャッジが継続的な困難を検出した場合にのみ、より強力なフロンティアモデルにタスクを昇格させます。LangChainによるベンチマークでは、Nemotron 3.5 LightningとClaude Opus 4.8( Claude Opus 4.8はベンチマークに使用されたモデルとして言及されていますが、NVIDIAの製品ではありません。)の間でエスカレーションルーターを用いてルーティングを行った結果、フロンティアモデルのみを使用した場合と比較して74%のコスト削減を達成し、フロンティアモデルへの呼び出しは全体の7%に留まりました。これは約6ポイントの精度トレードオフを伴いますが、大幅な効率向上が示されています。
このライブラリは、品質、レイテンシ、コストといったパラメータに基づいて様々なルーティング戦略を柔軟に設定できるため、開発者は特定のニーズに合わせて最適化されたルーティングソリューションを構築できます。オープンモデル、プロプライエタリモデル、NVIDIAモデルなど、開発者が持つ多様なモデル群を横断してインテリジェントにリクエストを振り分けることが可能です。
エージェントAIシステム構築への貢献と広範な産業応用
NVIDIAがNemotron 3.5 LightningとNeMo Switchyardを同時にリリースしたことは、AIエージェントの設計と展開におけるパラダイムシフトを意味します。これは「常に稼働するAIエージェント」や、専門化されたモデルのシステム(モデルアンサンブル)というNVIDIAのビジョンを具体化するものです。Nemotron 3.5 Lightningのような特化型モデルが特定の高頻度タスクを効率的に処理し、NeMo Switchyardがこれらのモデル間をインテリジェントにルーティングすることで、より複雑で堅牢なエージェントシステムが実現可能になります。
これらの技術は、サイバーセキュリティ、法律サービス、ソフトウェアエンジニアリング、金融サービス、ヘルスケア、ライフサイエンスといった多岐にわたる産業での応用が期待されています。実際、CrowdStrike、Harvey、CodeRabbit、Fastino Labs、Lila Sciencesといった業界のプレイヤーが、Nemotron 3.5 Lightningをサイバーセキュリティ、法務、コーディング、金融、ヘルスケアのワークロード向けに既にカスタマイズしていると報じられています。
Nemotron 3.5 Lightningの単一GPUでの展開能力は、ソロ開発者やシードステージのスタートアップから、中規模企業、さらには規制の厳しいエンタープライズ(オンプレミスでの完全な運用が可能)まで、幅広いユーザーにフロンティアレベルのAIエージェント技術へのアクセスを提供します。これにより、AIエージェントの民主化と、多様なビジネス環境での迅速なイノベーションが促進されるでしょう。
開発者・エンジニア視点での考察
-
コスト効率とパフォーマンスの最適化: Nemotron 3.5 Lightningの混合エキスパート (MoE) アーキテクチャとNeMo Switchyardのインテリジェントなルーティング戦略の組み合わせは、AIエージェントの運用コストを劇的に削減する可能性を秘めています。単一GPUでの高性能モデル展開と、必要に応じてのみ高価なフロンティアモデルにタスクをエスカレーションするSwitchyardの能力は、特にリソースが限られたスタートアップや中小企業にとって、以前は非現実的だった複雑なエージェントAIの実験と商用利用を可能にし、開発者が推論コストを気にすることなくイノベーションを追求できる環境を提供します。
-
モジュラー型AIエージェントシステムの設計促進: NeMo Switchyardの導入は、AIエージェントのアーキテクチャ設計に大きな影響を与えます。開発者は、Nemotron 3.5 Lightningのような特定のタスクに特化した軽量モデルと、より汎用的な大規模推論モデルを組み合わせて、モジュラーかつスケーラブルなマルチエージェントシステムを構築しやすくなります。これにより、各コンポーネントの責任が明確になり、システムの堅牢性、デバッグの容易さ、およびメンテナンス性が向上し、複雑なエージェントワークフローの管理がよりシンプルになるでしょう。
-
オープンソースと深いカスタマイズの機会: Nemotron 3.5 LightningがOpenMDW-1.1ライセンスの下でオープンウェイト、トレーニングデータ、レシピを提供し、NeMo SwitchyardがGitHubで公開されたことは、開発者コミュニティにとって計り知れない価値があります。これにより、企業や個々の開発者は、自身のドメイン固有データや既存のツール、ワークフローに合わせてモデルやルーティング戦略を深くファインチューニングし、最適化することが可能になります。これは、クローズドモデルでは実現が難しい、特定の産業やユースケースにおけるAIエージェントの精度と適合性を劇的に向上させるための、強力な基盤を提供します。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


