NVIDIA Nemotron 3.5 Lightning: 長時間稼働エージェント向け高速・高精度タスク実行を実現


ADVERTISEMENT

NVIDIA Nemotron 3.5 Lightningの概要とエージェントAIにおける役割

NVIDIAは、長時間稼働するAIエージェントの専門タスク実行に特化したオープンな300億パラメータ混合エキスパート(MoE)モデル、「Nemotron 3.5 Lightning」を発表しました。このモデルは、常時稼働するAIエージェントやエージェントワークフローにおける高ボリュームかつ低レイテンシの実行に最適化されており、わずか30億のアクティブパラメータで動作します。現代のエージェントシステムは、複雑な計画とオーケストレーションを担うNemotron 3 Ultraのようなフロンティア推論モデルと、コードレビュー、ツール利用、セキュリティアラート監視、請求に関する質問応答といった特定のタスクを実行する、より小型で効率的な専門モデルを組み合わせた「モデルのシステム」として機能する傾向があります。Nemotron 3.5 Lightningは、このうち後者の、高ボリュームの実行層を担うように設計されており、効率性とコスト削減に貢献します。

革新的なアーキテクチャと技術的最適化

Nemotron 3.5 Lightningは、ハイブリッドなMamba-Transformerアーキテクチャを基盤とし、Mamba-2とMoE層、そして一部のアテンション層を組み合わせた混合エキスパートアーキテクチャを採用しています。MoEアーキテクチャは、各トークンが多数のエキスパートのうちごく一部にのみルーティングされるため、モデルパラメータの一部のみが実行され、大規模な高密度モデルの能力を小型モデルの計算コストで実現できる点で高速かつ効率的です。また、本モデルには、以下のような推論およびトレーニングにおける革新技術が組み込まれています:

  • 投機的デコーディング (Speculative Decoding): Multi-token predictionに加え、低並行性データセンターおよびDGX Sparkワークフロー向けのDSpark、より包括的な推論最適化のためのDFlashなどの手法が採用され、テキスト生成速度を向上させています.
  • ハーネス最適化トレーニング (Harness-Optimized Training): 一般的なエージェントハーネス向けにトレーニングされており、高ボリュームのタスクにおいてエージェントがより正確な呼び出しを行い、レイテンシを削減できます.
  • 量子化: NVFP4およびBF16のチェックポイントが提供され、さまざまなハードウェアでの効率的なデプロイメントを可能にします.

これらの最適化により、Nemotron 3.5 Lightningは同サイズのモデルと比較して最大4倍の出力速度を実現し、人工分析インテリジェンスインデックスにおける精度と速度のパレート最適フロンティアを達成しています。具体的には、PinchBench(エージェントタスク、コーディング、研究、ファイル管理を網羅する実世界ベンチマーク)において、Qwen3.6-35Bと同等の精度を約30%速く達成しています。

パフォーマンスと実用性、そしてNVIDIA NeMo Switchyardとの連携

Nemotron 3.5 Lightningは、最大100万トークンのコンテキスト長をサポートし、NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA Jetsonといったローカルハードウェアから、データセンター、クラウド環境まで、幅広いプラットフォームで展開可能です。また、vLLM、Ollama、llama.cpp、LM Studio、Unslothといったオープンソースフレームワークを介して展開できるため、開発者は多様なデプロイメントオプションを享受できます.

さらにNVIDIAは、AIエージェントのワークフローにおいて、タスクごとに最適なモデルをインテリジェントにルーティングするオープンソースライブラリ「NVIDIA NeMo Switchyard」もリリースしました。NeMo Switchyardは、モデルの能力、コスト、インフラストラクチャのシグナルに基づいて最適なモデルを動的に選択することで、効率性と出力品質を向上させます。これにより、フロンティアモデルのみを使用する場合と比較して、ベンチマークの完了コストを約3分の1に削減できることが示されています。Nemotron 3.5 LightningとNeMo Switchyardを組み合わせることで、開発者はエージェントAIのデプロイ方法、実行場所、運用効率に対してより高度な制御が可能になります。

開発者・エンジニア視点での考察

  1. 高効率なドメイン特化型エージェントの迅速な構築: Nemotron 3.5 Lightningは、オープンモデルであり、NVIDIA NeMoライブラリを用いて独自のドメインデータで容易にファインチューニングやポストトレーニングが可能です。これにより、企業は特定の業務(例:法務、医療、金融)に特化した高精度かつ高効率なサブエージェントを、最小限の設備とコストで迅速に開発・展開し、既存のワークフローに組み込むことが可能になります。

  2. NeMo Switchyardによるコスト最適化とモデル選択の自動化: NeMo Switchyardの導入は、複雑なエージェントシステムにおいて、タスクの種類に応じて高性能なフロンティアモデルとNemotron 3.5 Lightningのような効率的な専門モデルを動的に切り替えることで、大幅なコスト削減とリソース効率の向上を実現します。開発者は、手動でルーティングロジックを実装・保守する手間を省きつつ、タスク完了の精度を維持しながら運用コストを最適化できるため、よりスケーラブルなエージェントアプリケーション設計に注力できます。

  3. エッジからクラウドまでの柔軟なデプロイメント戦略: Nemotron 3.5 Lightningは、NVIDIA RTX PCやJetsonといったエッジデバイスから、DGX Spark、データセンター、クラウド環境まで、幅広いハードウェアでのデプロイメントをサポートしています。これは、開発者がアプリケーションのレイテンシ要件、データプライバシー、計算リソースの制約に応じて最適なデプロイメント戦略を選択できることを意味します。例えば、リアルタイム処理が必要なエッジAIアプリケーションではローカルデプロイメントを、大規模なデータ処理や推論が必要な場合はクラウドを、といった柔軟な選択が可能となり、多様なユースケースに対応するエージェント開発を加速させます。


Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT