Google DeepMind「Gemini Robotics 2」発表:全身制御と高度な協調動作を実現


ADVERTISEMENT

Google DeepMindは、次世代ロボットAIモデルスイート「Gemini Robotics 2」を発表しました。この新モデル群は、人型ロボットの全身制御、高度な器用な操作、およびマルチロボット協調を実現し、現実世界でのロボットの適応性と有用性を飛躍的に向上させます。特に注目すべきは、従来のモデルが主に上半身の操作に焦点を当てていたのに対し、Gemini Robotics 2が「足先から指先まで」の全身動作を単一の学習ポリシーで制御できるようになった点です。これにより、ロボットはより複雑で人間中心の環境において、自然で効果的な動作を遂行できるようになります。

全身インテリジェンスと多様なロボットプラットフォームへの対応

Gemini Robotics 2は、ビジョン・言語・アクション(VLA)モデルとして、視覚および言語入力をロボットの運動制御に変換します。このモデルは、ApptronikのApollo 2人型ロボットを主なデモンストレーションプラットフォームとして、全身にわたる自律的な機能を実現しています。例えば、「じょうろを下段の緑のゴミ箱に入れる」といった指示に対し、Apollo 2は物体を認識し、部屋を歩き、かがんで物体を拾い上げ、正確な位置に置く一連の動作を実行可能です。

Gemini Robotics 2は、人型ロボットだけでなく、デュアルアームロボットや産業用マニピュレーターなど、多様なロボットプラットフォームへの展開を念頭に設計されています。これにより、単一の基盤モデルを様々なロボットハードウェアに適用できる汎用性が向上し、開発者は特定のロボットタイプごとにAIを開発する従来のやり方から脱却できるようになります。

進化した器用な操作とマルチロボット協調

Gemini Robotics 2は、ロボットの物理的な器用さにおいても新たなレベルを解き放ちます。特に、5本指で22自由度を持つSharpaWaveハンド(Apollo 2ロボットに搭載)を制御し、結び目を作る、ジップロックバッグを密閉する、電球をねじ込むといった繊細な作業を実行できます。 また、Franka Duoプラットフォーム上の標準的な2本指パラレルグリッパーも操作し、密なパッキングのような複雑な器用なタスクもこなすことができます。

さらに、Gemini Robotics 2はマルチロボット協調能力を導入し、異なるタイプのロボットが共通のセマンティック理解を通じて通信し、タスクを分担して複雑なワークフローを完了することを可能にします。これにより、屋内で優れた性能を発揮する車輪型ロボットと、不整地で優れた性能を発揮する人型ロボットが連携して、単一のロボットでは達成困難なタスクを効率的に遂行できるようになります。

エージェント型推論モデル「Gemini Robotics ER 2」とオンデバイス展開

Gemini Robotics 2スイートは、主に以下の3つのモデルで構成されています。

  1. Gemini Robotics 2 (VLA):前述の通り、視覚と言語入力を運動制御に変換する主要なアクションモデルです。

  2. Gemini Robotics ER 2 (Embodied Reasoning / VLM):ロボットの「高レベルの脳」として機能する、最も有能な組み込み推論モデルです。これは人間と会話したり、物理世界を理解したり、数分間にわたるマルチステップタスクを計画したりする能力を持ち、低レイヤーのVLAモデルに運動実行を委ねます。 Gemini Robotics ER 2は、生のビデオフィードから実行中の失敗を検出し、リアルタイムでタスクの進捗を追跡する能力(進捗分類タスクで57.4%の精度)や、Google Searchやユーザー定義関数などの外部ツールを呼び出す機能により、自己修正と適応性を強化しています。 このモデルは、Gemini 3.5 Flashをベースにしており、最大128kのコンテキストウィンドウでテキスト、画像、ビデオ、オーディオのインターリーブ入力を受け入れます。

  3. Gemini Robotics On-Device 2 (Lightweight VLA):ロボットデバイス上でローカルに実行するために最適化された軽量VLAモデルです。このモデルは、インターネット接続なしで動作し、わずか数時間のデータと200未満のデモンストレーション例で、まったく新しいロボットエンボディメントに迅速に適応できます。

Googleは、これらのモデルがロボットの汎用的な物理的AIへの道のりにおいて重要な一歩であると位置づけています。

開発者・エンジニア視点での考察

  1. 多種多様なロボットハードウェアへの迅速な適応性と、わずかな学習データでの転移学習の容易さは、開発者が特定のロボットプラットフォームに縛られず、AIモデルの汎用性を高める上で極めて重要である。Gemini Robotics On-Device 2が提供する「数時間のデータで新しいロボットへの適応」という機能は、プロトタイピングから実用化までの期間を劇的に短縮し、ロボット開発におけるハードウェアとソフトウェアの結合を柔軟にする可能性を秘めている。

  2. 視覚-言語-行動(VLA)モデルと組み込み推論(ER)モデルの明確な分離は、高レベルな意思決定と低レベルな運動制御のモジュール化を促進し、開発者が各層を独立して最適化したり、特定のタスクに特化したVLAモデルをプラグインしたりする柔軟性を提供する。Gemini Robotics ER 2がGoogle AI StudioやGemini APIを通じて提供されることで、開発者はこの「高レベルの脳」を活用し、独自のVLAモデルやロボットハードウェアと連携させることで、高度な知能を持つエージェントを構築しやすくなる。

  3. ERモデルが提供するリアルタイムの進捗追跡、自己修正機能、およびツール呼び出し(Google Searchなど)は、複雑なマルチステップタスクの堅牢性を大幅に向上させる。これにより、開発者はエラーハンドリングのロバスト性を高め、より複雑で予測不能な環境でのロボット展開が可能になる。特に、生のビデオフィードから失敗を検出し、タスクの進捗をリアルタイムで追跡する能力は、ロボットが予期せぬ状況に遭遇した際の適応能力を飛躍的に向上させ、より安全で信頼性の高いシステム構築に貢献する。


Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT