Alibaba Amap、単一GPUで長時間動作するインタラクティブ動画・3Dシーン生成AIモデル「ABot World」を発表


ADVERTISEMENT

革新的なワールドモデル「ABot World」シリーズの登場

Alibaba傘下のロケーションベースサービスプラットフォームであるAmapは、生成AIの分野に画期的な進歩をもたらす「ABot-World」AIモデルシリーズを発表しました。このシリーズには、インタラクティブな動画と3Dシーンを統合されたフレームワーク内で生成できる「ABot-World-0」および「ABot-3DWorld-0」モデルが含まれます。特筆すべきは、これらのモデルが単一の一般消費者向けGPU上で1時間以上連続して動作する能力を持つ点です。これにより、物理環境をシミュレートするAIシステムである「ワールドモデル」分野における主要な制約が克服されます。既存の動画生成モデルは推論後約1分で品質が低下する傾向がありましたが、3Dシーンジェネレータは高忠実度のアセットを生成できるものの、複数のシーンを連続的な探索空間に結合することができませんでした。ABot Worldはこれらの課題に対処し、次世代のインタラクティブな仮想体験を可能にするものです。

インタラクティブ動画生成の技術的ブレイクスルー

ABot-Worldモデルは、動画生成の安定性に関する課題に対し、革新的な技術的解決策を導入しています。具体的には、シーンナビゲーションとキャラクター制御を単一の学習目標に統合することで、ユーザー入力に対する応答精度を向上させています。さらに、自己回帰推論中のエラー蓄積を緩和するための「時間的一貫性アルゴリズム(temporal-consistency algorithm)」を適用しており、これにより品質を損なうことなく1時間以上の安定した生成を可能にしています。このアーキテクチャには推論期間に対する組み込みの上限がなく、長時間の連続的なインタラクションをサポートします。従来の動画生成モデルが抱えていた、時間経過に伴うシーンの破綻や一貫性の喪失といった問題が、ABot-Worldによって大幅に改善されたことは、特にエージェントのシミュレーション環境や没入型コンテンツ制作において極めて重要です。

高忠実度3Dシーン生成と統合アーキテクチャ

3Dシーン生成においては、ABot-3DWorld-0モデルがAmapの先行モデルであるABot-Earth0.5と同一の推論経路を共有しています。これにより、屋内、街路レベル、航空都市スケールといった多様な規模で3D Gaussian Splatting (3DGS) アセットを生成できる単一のアーキテクチャを実現しています。出力されるシーンは、写真のようなリアルなテクスチャと物理的な境界を持つ認識可能な幾何学的構造を特徴とします。長時間のシーン合成における品質管理を保証するため、「生成-評価-修復 (generate-evaluate-repair)」というモジュラー型パイプラインが採用されています。Amapは、動画生成モデルと3Dシーン生成モデルを単一の製品に統合し、動画出力と3DGSアセットを相互変換して共同で保存できる機能を提供します。さらに、ユーザーが生成された任意の2つの3Dワールド間にアンカーポイントを作成できる「空間テレポート (spatial teleport)」メカニズムを導入し、これにより個別のシーンが拡張可能な探索ネットワークへとシームレスに織り込まれます。これらの推論タスクは、分散コンピューティングやクラウドアクセラレーターを必要とせず、単一の一般消費者向けGPUでローカルに実行可能であるとAmapは述べています。

開発者・エンジニア視点での考察

  1. エッジAIとローカルデプロイメントの新たな可能性: インタラクティブな動画および3Dシーン生成を「単一の一般消費者向けGPU」上で数時間にわたって実行できる能力は、これまでのAIモデルの計算リソース要求から大きく逸脱しています。これは、高価なクラウドインフラストラクチャへの依存を減らし、オンデバイスAIアプリケーション、ローカルなコンテンツ作成ツール、および分散型シミュレーション環境への道を開きます。開発者は、法外な計算コストなしに、よりリッチでアクセスしやすいインタラクティブ体験を構築できるようになります。

  2. リアルタイム物理シミュレーションとエージェント学習の加速: 1時間以上という連続的で安定した環境生成能力 とインタラクティブ機能の組み合わせは、身体性AIエージェントやロボットのトレーニングにABot-Worldを理想的なものにします。導入された「時間的一貫性アルゴリズム」や「生成-評価-修復」パイプラインは、シミュレーションの忠実度と持続時間における重要な課題に直接対処し、動的で物理的に根差した仮想世界でのより堅牢で長期的なエージェント学習を可能にします。

  3. 3Dコンテンツ制作ワークフローの変革と資産共有: 動画出力と3DGSアセットを統合的に変換・保存する統合フレームワーク、「空間テレポート」メカニズム、およびオープンなパブリックアセットライブラリ は、3Dコンテンツ制作を根本的に変革します。アーティストや開発者は、仮想環境を迅速に反復生成し、それらをシームレスにリンクさせ、再利用可能なアセットを共有することで、ゲーム、シミュレーション、仮想観光体験の制作時間を劇的に短縮できます。また、モデルウェイト、推論コード、デプロイメントガイドのオープンソース化は、コミュニティによる貢献とイノベーションをさらに促進します。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT