エージェントスキルでNVIDIA Cosmos 3を一日で後学習:物理AI開発の劇的加速


ADVERTISEMENT

NVIDIA Cosmos 3の革新的なオムニモデルアーキテクチャ

NVIDIAは、物理AI向けの世界初の完全なオムニモデルとして「NVIDIA Cosmos 3」を発表しました。このモデルは、ビジョン推論、ワールド生成、およびアクション予測を統一する画期的な「mixture-of-transformers」アーキテクチャを特徴としています。具体的には、観察を分析し、生成タワーに指示を供給する推論トランスフォーマーと、エキスパート生成トランスフォーマーを組み合わせることで、物理的に接地された仮想世界を大規模にスケールアップすることを可能にします。Cosmos 3は、テキスト、画像、動画、環境音、そしてアクション軌跡をネイティブに理解し、生成できる能力を持ち、物理AI開発におけるトレーニング時間を数ヶ月から数日に短縮する可能性を秘めています。

このモデルは、最高精度の物理シミュレーションを必要とする「Cosmos 3 Super」、速度を重視する「Cosmos 3 Nano」、そしてリアルタイム推論向けの「Cosmos 3 Edge」(近日公開予定)といった複数のバリアントで提供され、多様な開発ニーズに対応します。Cosmos 3は、以前は個別のモデル(Cosmos Predict、Cosmos Transfer、Cosmos Reason、Cosmos Policy)で提供されていた世界生成、制御された生成、シーン理解、ポリシー生成といった機能を単一のモデルで実現し、統一されたフォワードパスで多様なモダリティの推論と生成を可能にします。

エージェントスキルによる後学習と開発ワークフローの変革

NVIDIA Cosmos 3の最大の特徴の一つは、エージェントスキルを活用した迅速な後学習と開発ワークフローの効率化です。エージェントスキルは、NVIDIAの既存の物理AIスタック(Omniverse、Isaac、Metropolisなど)をコーディングエージェントがアクセス可能なツールとして提供します。これにより、複雑なトレーニング、シミュレーション、評価、デプロイメントといったワークフローが、反復可能でエージェントが実行可能な命令に変換されます。開発者は、特定のロボットエンボディメント、カメラレイアウト、作業空間、またはタスクに特化するためにCosmos 3をファインチューニングできます。

後学習の具体的な例としては、Cosmos 3をフォワードダイナミクスモデル(ロボットのアクション軌跡が与えられた場合に将来のビデオ状態を生成する、アクション条件付きワールド基盤モデル)として訓練する方法が挙げられます。これにより、ロボットが次に行うことをシミュレートでき、ロボティクスポリシー開発の核となる要素となります。この後学習プロセスは、LeRobot形式のデータセットで可能であり、カスタムロボットデータもLeRobot形式に変換することで利用できます。これらのエージェントスキルとツールは、GitHubおよびNVIDIA Brev(Physical AI Launchablesとして)を通じてオープンソースとして提供されており、研究者や開発者がエンドツーエンドの合成データ拡張および評価パイプラインを迅速に構築することを支援します。

物理AI分野におけるCosmos 3の多様な応用とインパクト

NVIDIA Cosmos 3は、自律システム開発の複数の領域において、物理AIの進化を大きく加速させる可能性を秘めています。

  • 自律走行車(AV): AV研究における「ロングテール問題」(まれな相互作用、異常な道路形状、照明の変化、エッジケースの挙動など、収集が困難だがトレーニングと検証に不可欠なシナリオ)に対処するため、高精度な合成データを生成することで、訓練と検証を強化します。これにより、実際の走行マイルに依存しない研究の進展が可能になります。
  • ロボティクス: ピックアンドプレース、器用な操作、さらには手術用ロボットのためのデータ生成など、多様なロボットタスクをサポートします。特に「Cosmos-H-Surgical-Simulator」は、現実の手術データから直接学習することでシム・トゥ・リアルギャップを縮小し、自律的な手術タスクの開発を支援します。
  • ビジョンAI: 欠陥画像生成スキル、ニューラルシーン再構築、ビデオ拡張機能を提供し、高精度なビジュアル検査モデルの構築に貢献します。これにより、開発者は希少な視覚ケースを作成し、モデルが正しく応答するかどうかを評価できます。

Cosmos 3は、物理世界の動力学を理解できる汎用基盤モデルであり、限られたトレーニングデータと断片化されたシミュレーションスタックでも、ロボット、自律走行車、ビジョンエージェントが実世界で汎化できるよう支援します。

開発者・エンジニア視点での考察

  1. データ効率とシム・トゥ・リアルギャップの解消: Cosmos 3のエージェントスキルによる合成データ生成と後学習は、現実世界での希少なエッジケースの再現や、多様な環境でのロボット挙動学習を大幅に加速します。特に、物理的に正確なシミュレーションと実世界への転移能力は、開発者が直面する最大の課題の一つであるシム・トゥ・リアルギャップの解消に大きく貢献するでしょう。

  2. モジュール化された開発パラダイムへの移行: エージェントスキルがNVIDIAの既存の物理AIスタック(Omniverse、Isaac、Metropolisなど)を呼び出し可能なツールとして提供することで、複雑なパイプライン構築のボトルネックが解消されます。これにより、開発者は個々のコンポーネントの統合ではなく、エージェントが実行可能な高レベルな命令としてワークフローを定義するモジュール化された開発パラダイムに移行できます。

  3. 多目的基盤モデルの専門化と適応性: Cosmos 3のようなオムニモデルが汎用的な物理世界理解能力を持つ一方で、エージェントスキルを用いた後学習により、特定のロボットエンボディメント、センサーレイアウト、タスクに特化したモデルを効率的に構築できます。これにより、汎用性と専門性の両立が可能になり、多様な産業アプリケーションへの迅速な展開が実現します。


Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT