NVIDIA AVOがARC-AGI-3で100%達成:長期的自律エージェントのための汎用アーキテクチャを実証
NVIDIA AVOの革新的アーキテクチャと汎用性
NVIDIAが開発したAgentic Variation Operators (AVO)は、長期間にわたる自律的な運用に焦点を当てた汎用コーディングエージェントシステムです。従来の進化探索システムにおける事前定義された変異ステップを、自律エージェントが「次候補をどのように生成するか」を決定するプロセスに置き換えることで、その革新性を示しています。AVOは、既存の実装の検査、仮説形成、変更の実施、ハードウェアに根ざしたテストの実行、フィードバックの解釈、そして繰り返しのアプローチ修正といった能力を備えています。
このアーキテクチャは、単一の応答でコードを生成する以上のことを必要とする困難なソフトウェアエンジニアリングタスクやGPUカーネル最適化タスクで初めて実証されました。特に、AVOはNVIDIA Blackwell (B200) GPU上で7日間自律的に動作し、注目カーネルの最適化において、cuDNNを最大3.5%、FlashAttention-4を最大10.5%上回る性能を持つコードを生成することに成功しました。 これは、AVOが候補生成器としてだけでなく、検査、変更、テスト、コミットを自律的に決定する変異オペレーターとしての役割を果たす能力を持つことを明確に示しています。 また、AVOのメモリシステムは、有用な理解を継続的に持ち越し、反復的な探索を減らすように設計されており、長期的な自律作業を支える重要な要素となっています。
ARC-AGI-3ベンチマークの理解とAVOの画期的な達成
ARC-AGI-3は、AIエージェントが未知の環境を探索し、その場で目標を習得し、適応可能な世界モデルを構築し、継続的に学習することを課題とするインタラクティブな推論ベンチマークです。 このベンチマークは、静的なパズルを解くのではなく、エージェントが経験から学び、何が重要かを認識し、行動を選択し、自然言語の指示に頼らずに戦略を適応させる能力を評価します。 100%のスコアは、AIエージェントが人間と同じ効率で全てのゲームをクリアできることを意味し、人間の学習効率に対するAIのギャップを測定することを目的としています。
今回の発表では、NVIDIA AVOがARC-AGI-3の全183レベルで100%のスコアを達成したことが報告されました。 これは、以前にClaude Opus 5が公開セットで約30%のスコアであったこと、またはNVIDIAの別のエージェントシステムであるNOOAがGPT-5.6-solを用いて85.1%のRHAE (Relative Human Action Efficiency) を達成したこと と比較して、画期的な進歩です。この成功は、言語モデルを単体で使用するのではなく、AVOのようなエージェントシステム(ハーネスとも呼ばれる)がモデルがコンテキストを受け取り、ツールを使用し、状態を維持し、フィードバックに応答し、失敗から回復し、長期にわたるタスクで進行を維持する方法を決定することの重要性を浮き彫りにしています。 AVOの基礎となるエージェントはGPU最適化タスクのものと同一であり、環境固有のツールと評価インターフェースのみがARC-AGI-3用に調整されました。
長期的自律エージェントにおけるエージェントシステムの重要性
フロンティアレベルの言語モデルは、AIエージェントの構成要素の一つに過ぎません。そのモデルを取り巻くエージェントシステム、すなわち「ハーネス」が、モデルがどのようにコンテキストを受け取り、ツールを使用し、状態を維持し、フィードバックに応答し、失敗から回復し、長期にわたるタスクで進行を維持するかを決定します。 長期にわたる多段階タスクでフロンティア言語モデルを確実に機能させるエージェントアーキテクチャを構築することが、大きな課題でした。NVIDIAのAVO研究プロジェクトは、この汎用エージェントアーキテクチャ構築の課題に取り組んでいます。
AVOのARC-AGI-3における100%達成は、エージェントアーキテクチャが、指示や明示的なルール、目標なしにエージェントを未知の環境に配置するインタラクティブな推論ベンチマークにおいて、モデルの性能を飛躍的に向上させる可能性を実証しました。 これは、AIエージェントがより能力を高め、より長い期間にわたって運用されるにつれて、それらが活用するアプリケーションにセキュリティと信頼を組み込むことがますます重要になることを示唆しています。 エージェントスタックにおけるハーネス層の役割は、単なる性能向上だけでなく、エージェントが予期しない経路をたどるリスクを軽減し、行動の安全性を確保する上でも極めて重要です。
開発者・エンジニア視点での考察
-
エージェントシステム設計へのパラダイムシフト: LLM単体ではなく、ツール連携、状態管理、エラー回復を含む堅牢なエージェント「ハーネス」の設計が、フロンティアレベルの性能を引き出す鍵であることを示唆しています。開発者は、プロンプトエンジニアリングだけでなく、エージェントが環境とインタラクトし、長期的な目標を達成するためのアーキテクチャ全体の設計に注力する必要があります。
-
長期的タスクにおけるメモリ管理と適応戦略: AVOの記憶システムが反復的な探索を減らし、有用な理解を継続的に保持する設計は、複雑で長期間にわたる自律タスクにおいて、エージェントの効率とロバスト性を向上させるための重要な指針となります。開発者は、エージェントの「学習履歴」と「世界モデル」の動的な更新・管理メカニズムを深く検討し、状態の永続化と効率的なコンテキスト管理を実装することで、より高性能なエージェントを構築できるでしょう。
-
汎用エージェントアーキテクチャの再利用可能性: GPUカーネル最適化からARC-AGI-3といった異なるドメインのタスクへのAVOの適応性は、基盤となるエージェントアーキテクチャが環境固有のツールとインターフェースを介して、幅広い問題に適用可能であることを示しています。これは、一度強力な汎用エージェントフレームワークを構築すれば、それを多様な応用分野へ展開し、専門的なタスクを自律的に解決できる可能性を示唆しており、将来的なAI開発の効率化に貢献するでしょう。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


