Orchard: スケーラブルなエージェントAIを実現するマイクロソフトのオープンフレームワーク


ADVERTISEMENT

Orchard Env: エージェント基盤の革新的な分離アーキテクチャ

Microsoft Researchが発表したOrchardは、大規模言語モデル (LLM) を自律的なエージェントに変換し、計画、推論、ツール利用、多段階対話を通じて複雑なタスクを解決することを目指す、スケーラブルなエージェントAIのためのオープンソースフレームワークです。その中核をなすのが「Orchard Env」という軽量な環境サービスです。

Orchard Envは、Kubernetesネイティブな設計を採用しており、タスクドメイン、エージェントハーネス、およびパイプラインステージ(軌跡の蒸留、オンポリシー強化学習(RL)ロールアウト、評価など)を横断して、サンドボックスのライフサイクル管理のための再利用可能なプリミティブを提供します。このアーキテクチャの最大の特長は、環境層を学習ループから根本的に切り離している点にあります。標準的なKubernetes APIサーバーを介したPod作成のコールドパスに対し、コマンド実行のホットパスは制御プレーンを迂回し、オーケストレーターがサンドボックスPodのIPを介してインポッドエージェントにHTTPで直接リクエストをルーティングします。これにより、制御プレーンの仲介とWebSocketのオーバーヘッドが削減され、大規模な強化学習ロールアウトに必要な高スループット・低遅延のインタラクションを実現しています。この分離設計は、インフラのボトルネックを解消し、エージェント研究におけるオープンなスケーラビリティと再現性を大きく向上させます。

多様なタスク領域への応用とSOTA性能

Orchard Envを基盤として、Microsoft Researchは3つの具体的なエージェントモデリングレシピを開発し、その有効性を示しています。

  1. Orchard-SWE(ソフトウェアエンジニアリングエージェント): コーディングタスクを対象とし、MiniMax-M2.5やQwen3.5-397Bといったモデルから107Kの軌跡を蒸留して利用しています。未解決の軌跡から生産的なセグメントを学習するためのクレジット割り当てSFT(Supervised Fine-Tuning)を導入し、さらにRLにはBalanced Adaptive Rollout(BAR)を適用しています。Qwen3-30B-A3B-ThinkingをベースとしたOrchard-SWEは、SFT後にSWE-bench Verifiedで64.3%、SFT+RL後に67.5%の性能を達成し、同規模のオープンソースモデルの中で新たなSOTAを確立しています。また、Qwen3.5-35B-A3Bをバックボーンとしたバージョンでは、RPRベースのRLで69.7%、さらに価値モデルのリランキングを適用することでSWE-bench Verifiedで73.0%に達し、オープンソース手法の中で最先端を確立し、10倍以上の規模のフロンティアシステムに匹敵する性能を示しています。

  2. Orchard-GUI(視覚言語コンピュータ使用エージェント): わずか0.4Kの蒸留された軌跡と2.2Kのオープンエンドタスクを使用して、4Bの視覚言語コンピュータ使用エージェントを訓練しています。WebVoyagerで74.1%、Online-Mind2Webで67.0%、DeepShopで64.0%の成功率を達成し、オープンソースモデルとして最強であると同時に、プロプライエタリシステムとも競争力のある性能を発揮しています。特筆すべきは、4Bのバックボーンモデルと2.6Kの学習タスクのみを使用しながら、235Bのティーチャーモデルをも上回る性能を示しており、環境に根ざしたRLがティーチャーモデルの能力を超えてエージェント能力を向上させられる可能性を示唆しています。

  3. Orchard-Claw(パーソナルアシスタントエージェント): 電子メール、カレンダー、日常のツール使用など、生産性ワークフロー向けのパーソナルアシスタントエージェントをターゲットとしています。わずか0.2Kの合成タスクで訓練され、Claw-Evalで59.6%のpass@3を達成し、より強力なZeroClawハーネスと組み合わせることで73.9%に向上しています。

これらの結果は、軽量でオープン、かつハーネスに依存しない環境層が、エージェントのデータ、トレーニングレシピ、評価プロトコルをドメイン間で再利用可能にすることを実証しています。

スケーラブルなエージェント学習を可能にする技術的アプローチ

Orchardフレームワークは、エージェントAIの学習におけるスケーラビリティと効率性を劇的に向上させるための複数の技術的アプローチを採用しています。

まず、環境と学習ループの分離は、従来の密結合な設計におけるインフラストラクチャの制約を打破します。Orchard EnvがKubernetesをベースとすることで、数千の隔離されたコンテナをオンデマンドで起動し、多段階のエージェントとサンドボックス間のインタラクション(実行、ファイルI/O、gitパッチなど)をHTTP経由で駆動します。これにより、学習プロセス中に環境の安定性とパフォーマンスが保証され、異なるタスクやエージェントハーネス間でのデータセット、学習レシピ、評価プロトコルの移植性が高まります。

次に、効率的な軌跡の蒸留とRL手法が挙げられます。Orchard-SWEにおけるクレジット割り当てSFTは、未解決の軌跡からでも有用な学習信号を抽出することを可能にし、学習データの利用効率を最大化します。また、Balanced Adaptive Rollout (BAR) は、スパースな報酬の最適化を支援し、オンポリシー蒸留 (OPD) やルブリックベースのプロセス報酬 (RPR) は、より密な教師信号を提供します。さらに、過去の経験からの蒸留(historical experience distillation)は、以前の実験のロールアウトをコンパクトな価値モデルに圧縮し、推論時のリランキングに活用することで、エージェントの探索効率と性能を向上させます。

最後に、Orchardはオープンソースコミュニティへの貢献を重視しており、フレームワーク全体(環境サービス、トレーニングレシピ、ソフトウェアエンジニアリング、GUIナビゲーション、パーソナルアシスタントのツール使用にわたる軌跡データセット)を公開することで、スケーラブルなエージェントモデリングのオープン研究を加速させることを目指しています。最近の拡張であるOpenForge RLでは、エージェントを簡略化された再実装環境ではなく、ZeroClaw, OpenClaw, Codexといった実際のデプロイメントハーネス内で学習させることを可能にし、訓練とデプロイのミスマッチを解消しています。これにより、エージェントが実世界でより堅牢に機能するようになります。

開発者・エンジニア視点での考察

  1. Orchard EnvのKubernetesネイティブな設計により、エージェント開発者はスケーラブルで隔離されたサンドボックス環境を容易に構築・管理できます。これにより、複雑なインフラストラクチャのセットアップから解放され、エージェントのロジックと学習アルゴリズム自体の開発に注力することが可能になります。

  2. Orchardが提供する「環境層の切り離し」は、エージェントの学習データ、学習レシピ、評価プロトコルの再利用性を劇的に高めます。これにより、異なるプロジェクトやタスクドメイン間で知見やアセットを共有しやすくなり、エージェント研究全体の開発効率とイノベーションの加速に大きく貢献します。

  3. クレジット割り当てSFTやBalanced Adaptive Rollout (BAR) といった高度な強化学習手法が具体的なレシピとして公開されており、開発者はこれらの実装を参考に、自身のカスタムエージェントの性能を向上させるための実用的なアプローチを迅速に導入・実験することができます。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT