NVIDIA AI、エージェンティック強化学習向けPyTorchネイティブフレームワーク「MOLT」をリリース


ADVERTISEMENT

MOLTの概要と設計哲学

NVIDIA AIのNeMoチームは、エージェンティック強化学習(RL)研究の効率を劇的に向上させることを目的としたPyTorchネイティブのフレームワーク「MOLT」を発表しました。従来のRLフレームワークは、アルゴリズムの変更のたびにトレーナー、分散バックエンド、ロールアウトの各層にわたる複雑な調整が必要となり、研究者に大きな負担を強いていました。MOLTはこの問題に直接対処し、研究者がコードベース全体を頭の中で把握し、AIコーディングアシスタントが完全に理解・推論できるほどコンパクトでクリーンな設計を目指しています。

MOLTのRLコードベースは、約8.6K行と非常にコンパクトであり、これは既存の主要なRLフレームワークであるverlの約7分の1(62K行)、slimeの約3分の1(25K行)に相当します。 この「リーンな設計」は、パフォーマンスを犠牲にすることなく、研究の反復コストを最小限に抑え、アルゴリズムフローの End-to-End での追跡と変更を可能にすることをMOLTの核となる哲学としています。

アーキテクチャと技術的詳細

MOLTは、そのコンパクトな設計にもかかわらず、最先端のエージェンティックRLを大規模に実行するための強力なアーキテクチャを特徴としています。主要なコンポーネントとして、以下の3つを連携させています。

  1. Ray: コンポーネントの配置と非同期キューの管理に使用されます。これにより、分散システムにおける効率的なタスクスケジューリングとデータフローが実現されます。

  2. vLLM: ロールアウトエンジンとして機能し、推論処理を高速化します。vLLMの上に構築されたMOLTは、1TクラスのMoE(Mixture-of-Experts)モデルへのスケーリングを可能にします。

  3. NVIDIA AutoModel + FSDP2: 純粋なPyTorchでトレーニングを実行するための基盤となります。FSDP2(Fully Sharded Data Parallel 2)と組み合わせることで、大規模なモデルでも効率的な分散学習が可能です。

MOLTは、これらのコンポーネントをフォークすることなく合成することで、上流のリリースがシームレスにMOLTに統合されるように設計されています。また、MOLTの非同期ループは、マルチモーダルおよびMoEポリシーをトレーニングする際に、エージェントが生成していないトークンでトレーニングを行わない「トークンファースト」のアプローチを採用しており、トークン、ポリシーバージョン、モデルセマンティクスの一貫性を厳密に保証します。

パフォーマンスとスケーラビリティ

MOLTは、そのリーンな設計にもかかわらず、高性能を維持するように構築されています。NVIDIAの研究論文では、MOLTが、整合された完全に非同期なプロトコルにおいて、最先端のMegatronベースのスタックと統計的に同等の性能を発揮することが示されています。 このことは、コードベースの複雑さを軽減しながらも、最先端のRL研究に必要なパフォーマンスレベルを提供できることを意味します。

スケーラビリティに関しても、MOLTはDeepSeek-V3のような1TクラスのMoEモデルをサポートし、エキスパート並列処理(例: --fsdp.ep_size 256)やAdam CPUオフロードなどの最適化を利用して、大規模な学習に対応します。 出荷されるレシピでは、トレーニング用に8基、ロールアウト用に8基のH100 GPUを搭載した2ノード構成を想定しており、フロンティア研究機関、資金潤沢なAIスタートアップ、金融・ヘルスケア・ロボティクス分野の企業AI研究グループなどがターゲットユーザーとして位置付けられています。

MOLTは、マルチターンツール利用エージェント、コード実行エージェント、視覚言語環境(提供されているgeo3kレシピ)、LLM-as-judge報酬ループ、およびより小型の学生モデルへのオンポリシー蒸留など、幅広いエージェンティックRLアプリケーションを可能にします。

開発者・エンジニア視点での考察

  1. MOLTのコンパクトなコードベースは、RLアルゴリズムの迅速なプロトタイピングと実験を可能にします。研究者は、大規模なフレームワークの内部実装の複雑さに煩わされることなく、純粋なアルゴリズム開発に集中でき、これにより研究サイクルが大幅に短縮されると予想されます。

  2. PyTorchネイティブかつ「エージェントは通常のプログラム」という設計思想は、既存のPyTorchモデルやツール群との統合を容易にします。開発者は、慣れ親しんだPyTorchエコシステム内でエージェントの振る舞いや報酬関数を柔軟に定義でき、カスタム環境や新しいタスクへの適応性が高まります。

  3. RayとvLLMの採用により、MOLTは計算資源の効率的な利用と大規模モデルの高速ロールアウトを両立しています。これは特に、LLMをエージェントのバックボーンとして利用するエージェンティックRLにおいて、計算コストの削減とトレーニング時間の短縮に直結し、より複雑なエージェント行動の探索やポリシーの改善に貢献します。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT