NVIDIA TensorRT Edge-LLMがJetson AGX ThorでMLPerf Edge Agenticベンチマークを6.4倍高速に完遂


ADVERTISEMENT

TensorRT Edge-LLMによるエッジLLM推論の飛躍的加速

NVIDIAのTensorRT Edge-LLMは、大規模言語モデル(LLM)およびビジョン言語モデル(VLM)を組み込みプラットフォーム上で効率的に推論するための、高性能なC++推論ランタイムです。本テクノロジーは、MLPerf Inference v6.1 Edge Agenticベンチマークにおいて、Qwen3.6-27Bモデルを単一のNVIDIA Jetson AGX Thor Developer Kit上で実行し、llama.cppリファレンス実装と比較して6.4倍の高速化を達成しました。この速度向上は、NVFP4量子化、ツリーベースのマルチトークン予測(MTP)、およびKVキャッシュの再利用といった最適化技術によって実現されています。

TensorRT Edge-LLMは、TensorRT上に構築されており、カスタムCUDAカーネル、カーネルフュージョン(例えば、MatMul + Bias + Activationを単一カーネルに統合)、静的メモリ割り当て、およびFP8/NVFP4量子化といったGPUレベルの最適化を活用します。これにより、モデルのメモリフットプリントを削減し、DRAM帯域幅によって制約されがちなエッジプラットフォームでの低バッチLLMデコーディング性能を大幅に向上させます。特に、Jetson AGX ThorのNVIDIA Blackwell GPUでサポートされるNVFP4量子化は、重みとアクティベーションのサイズを削減し、同時にMLPerfで要求される精度を維持します.

MLPerf Edge Agenticベンチマークとその意義

MLPerf Edge Agenticベンチマークは、クラウドデータセンターから車両、ロボット、その他のエッジデバイスへと移行しつつあるAIエージェントの、エンドツーエンドのパフォーマンスを測定するために導入されました。従来のチャットボットが単一のプロンプトに応答するのとは異なり、エージェントは一連のステップを経て動作し、ツールを選択し、その結果を評価し、長くなる会話の中で推論を継続します。このワークフローは、エッジ推論に対して新たな要求を課します。すなわち、モデルはトークンを素早く生成し、長い共有履歴を効率的に処理し、限られた電力とメモリの範囲内で有効なツール呼び出しを生成する必要があります。

MLPerf Edge Agenticベンチマークは、性能と精度の2つのフェーズでOpenAI互換のモデルエンドポイントを測定します。性能フェーズでは、記録されたソフトウェアエンジニアリングエージェントの軌跡を再生します。このワークロードは20の会話と1,007の生成ターンを含み、入力長はターンごとに増加し、約23.5Kトークンに達するため、長文コンテキスト処理が測定の重要な部分となります。精度フェーズでは、Berkeley Function Calling Leaderboard (BFCL) v4のプロンプトを使用し、モデルが正しい関数を選択し、有効な引数を生成するかを評価します。NVIDIA TensorRT Edge-LLMは、このベンチマークの性能ワークロードを24分36秒で完了し、52.33トークン/秒を達成しました。これは、llama.cppリファレンス実装の2時間37分と比較して6.4倍の高速化です.

Jetson AGX ThorにおけるエージェンティックAIの実現

NVIDIA Jetson AGX Thorは、NVIDIA BlackwellアーキテクチャGPUと128GBのLPDDR5Xユニファイドメモリを搭載し、生成AIおよびマルチモデル協調のために最適化された、エッジAIプラットフォームです。このプラットフォームは、ロボティクス、自律システム、およびAI駆動アプリケーション向けに強力なコンピューティング能力を提供します。特に、128GBのRAMは、gpt-oss-120bのような大規模LLMを特別な調整なしでロードできるほどの容量を持ち、データセンタークラスのインテリジェンスをエッジにもたらします。

TensorRT Edge-LLMとJetson AGX Thorの組み合わせは、エージェンティックAIアプリケーションをエッジで展開するための重要な基盤となります。MoE(Mixture of Experts)モデルのサポートにより、エッジデバイスは、はるかに小さなモデルの推論レイテンシとアクティブな計算フットプリントを維持しながら、大規模モデルの推論能力にアクセスできます。これにより、コードコパイロット、ロボティクスコントローラー、オンプレミスアシスタントといった、リアルタイム性が求められるエッジアプリケーションにおけるLLMの利用が大きく加速されます.

開発者・エンジニア視点での考察

  1. エージェンティックAIのエッジ展開における新たな可能性: TensorRT Edge-LLMとJetson AGX Thorによる性能向上は、これまでクラウド環境に限定されていた複雑なエージェンティックAIワークフローをエッジデバイス上で実現するための道を開きます。これにより、リアルタイム性が極めて重要となる自律走行車、ロボット、産業用自動化システムなどにおいて、低レイテンシ、高信頼性、そしてプライバシー保護を伴う高度な推論が可能になります。開発者は、クラウドへの依存を減らし、オンデバイスでのインテテンスを実現する新たなアプリケーションを設計できるようになります。

  2. 最適化スタックによる開発効率の向上: TensorRT Edge-LLMは、NVFP4量子化、KVキャッシュ再利用、MTPなど、LLM推論を最適化するための多岐にわたる技術を統合したC++ランタイムを提供します。この統合された最適化スタックを利用することで、開発者はLLMのパフォーマンスチューニングにかかる労力を大幅に削減し、アプリケーションロジックの実装に集中できます。特に、リソース制約のあるエッジ環境において、手動での低レベル最適化なしに高性能を引き出せることは、開発期間の短縮と品質向上に直結します。

  3. リアルタイム性とプライバシー確保への貢献: エッジデバイス上でのエージェンティックAIの高速実行は、リアルタイムな意思決定が求められるタスクにおいて不可欠です。例えば、ロボットが環境とインタラクトする際に、迅速な応答は安全と効率に直結します。また、機密性の高いデータを扱う医療や防衛などの分野では、データをデバイス外に送ることなく処理できるため、プライバシーとセキュリティの要件を高いレベルで満たすことができます。この能力は、エッジAIの採用を促進する強力な要因となるでしょう。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT