NVIDIA Nemotron 3.5 Lightning発表:エージェントAI向け超高速・高効率オープンモデルの革新


ADVERTISEMENT

NVIDIA Nemotron 3.5 Lightningの概要と革新的なアーキテクチャ

NVIDIAは、常に稼働するAIエージェントおよびエージェントワークフローにおける高頻度かつ低遅延の実行に特化したオープンモデル「NVIDIA Nemotron 3.5 Lightning」を発表しました。このモデルは、300億の総パラメータと30億のアクティブパラメータを持つMixture-of-Experts(MoE)アーキテクチャを採用しており、高効率と高速性を両立させています。

Nemotron 3.5 Lightningは、既存のNemotron 3 Nanoの後継であり、ハイブリッドMamba-Transformerアーキテクチャを継承し、Mamba-2層とMoE層、選択されたAttention層を組み合わせています。 この設計により、モデルはより少ない計算コストで大規模な密なモデルと同等の能力を発揮し、特に長時間の実行を要するAIエージェントの実行レイヤーに最適化されています。 NVIDIA Nemotron 3 Ultraから蒸留されており、エージェントパイプラインの効率的なワークホースとして機能するように設計されています。

エージェントAIに最適化された卓越した性能

Nemotron 3.5 Lightningは、そのクラスで最高の出力速度と高い精度を提供し、高速エージェントワークロード向けの精度と速度のパレートフロンティアを確立しています。 同サイズのモデルと比較して最大4倍の出力速度を実現し、PinchBenchでは86%の精度を達成しながら、Qwen3.6 35Bよりも10,000タスクを30〜35%速く完了することが報告されています。

人工知能指数(Artificial Analysis Intelligence Index)では24点を獲得し、Nemotron 3 Nanoの15点から9点の改善を見せています。 GDPval-AA v2では824のEloスコアを達成し、Nemotron 3 Superやgpt-oss-120bをも上回っています。 さらに、Terminal-Bench v2.1では24%のスコアを記録し、Nemotron 3 Nanoの7%を3倍以上上回る性能を示しています。 推論のスループットとトークン効率の向上により、常に稼働するエージェントが高頻度の作業をより迅速に完了できるよう支援します。

技術的特徴と開発者向けエコシステム

本モデルは、高速なテキスト生成を可能にする投機的デコーディング(DFlash投機的デコーディングを含む)や、ハーネス最適化されたトレーニングなどの技術が組み込まれています。 量子化技術としては、NVFP4とBF16の両方のチェックポイントが提供されており、特にNVFP4バリアントはほとんど損失なしで高い精度を維持することが確認されています。

また、100万トークンという広範なコンテキストウィンドウに対応し、OpenClawやHermes Agentなどの一般的なエージェントハーネスと直接統合可能です。 NVIDIA NemoClawオープンソースセキュリティおよび管理スタックが、常に稼働するAIエージェントの実行をサポートします。 Nemotron 3.5 Lightningはオープンデータセットで完全にオープンにトレーニングされており、企業は独自のツール、ワークフロー、ポリシーに合わせて後続のトレーニングを行い、エッジ、オンプレミス、またはクラウドインフラストラクチャ全体で完全な所有権を持ってデプロイできます。

NVIDIAは、タスクを最適なモデルにインテリジェントにルーティングするためのオープンソースライブラリ「NVIDIA NeMo Switchyard」も発表しました。 これは、AIエージェントが複数のモデルを組み合わせて複雑なタスクを処理する現代のアプリケーション開発において重要な役割を果たします。 Amazon SageMaker JumpStartでも利用可能であり、AWS顧客は数回のクリックでモデルをデプロイできます。

開発者・エンジニア視点での考察

  1. エージェントワークフローの効率化とコスト削減への貢献: Nemotron 3.5 Lightningは、高頻度かつ低遅延の実行に特化しているため、AIエージェントのツール呼び出し、結果検証、サブエージェント委譲といった実行レイヤーのタスクを大幅に効率化します。これにより、従来のフロンティア推論モデルを全てのステップに利用する場合と比較して、計算コストと遅延を劇的に削減でき、より経済的で応答性の高いエージェントシステムの構築が可能になります。

  2. オープン性とカスタマイズ性による多様なユースケース対応: 完全なオープンソースモデルであり、オープンデータセットでトレーニングされているため、開発者は特定のビジネス要件やドメイン知識に合わせてモデルを自由にファインチューニングし、カスタマイズできます。これにより、パーソナルアシスタント、金融文書処理、サイバーセキュリティのトリアージ、通信業務など、幅広いエンタープライズ領域での高スループットな自動化を、高い柔軟性をもって実現できます。

  3. NeMo Switchyardとの連携によるモジュラー型AIシステムの構築: NeMo Switchyardライブラリの登場は、AIエージェントが単一のモデルに依存するのではなく、複数の専門モデルをインテリジェントにルーティングして利用するモジュラー型AIシステムの設計を促進します。これにより、複雑な計画やオーケストレーションをNemotron 3 Ultraのようなフロンティア推論モデルが担当し、高頻度の実行レイヤーをNemotron 3.5 Lightningのような効率的なモデルが担う、ハイブリッドかつ最適化されたアーキテクチャの構築が加速されます。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT