Minimax、汎用マルチモーダルAI「H3」を発表:次世代ビデオ生成技術の深掘り


ADVERTISEMENT

Minimax H3マルチモーダルAIの概要と革新的な能力

2026年7月31日、Minimaxは汎用マルチモーダル生成モデル「H3」をリリースしました。H3は、テキスト、画像、動画、音声を統一された文脈で理解し、ネイティブステレオサウンド付きの動画を生成するという点で、従来のモデルとは一線を画しています。最大15秒間の2K解像度(短辺1440ピクセル)の動画を、ネイティブなデュアルチャンネルオーディオと共に生成することが可能です。

H3は、テキスト指示の理解、正確なテキストおよびブランドレンダリング、V2V (Video-to-Video) モーション転送において優れた性能を発揮し、広告、ブランディング、Eコマース、製品設計、UI/UX、ゲームなど、幅広い商業コンテンツ制作のユースケースに対応しています。特に、ByteDanceのクローズドソースモデルであるSeedance 2.5と比較して、APIの1秒あたりの価格が3分の1以下(2K解像度の場合)、または主流モデルの720p解像度と比較して768pで半額以下と、業界をリードする価格性能比を実現しています。Minimaxは、数日中にH3のモデルウェイトをオープンソース化する計画を発表しており、オープンソースコミュニティへの貢献と、より広範なAIハードウェアとの互換性の加速を目指しています。

基盤となるアーキテクチャと技術的詳細

Minimax H3は、その卓越した性能を実現するために、複数の革新的な技術的要素を統合しています。核となるのは、テキスト、画像、音声、動画といった異なる入力タイプを統一的な文脈で推論するために統合する「Contextual Omni Representation」です。

特筆すべきは、独自開発のVAEアーキテクチャである「H3-VAE」です。これは従来のトークナイザーを全面的に見直し、再構成品質と学習可能性を大幅に向上させています。H3-VAEの高い圧縮率は、実質的なシーケンス長を4倍に伸ばし、トレーニングおよび推論の計算コストを大幅に削減することで、ネイティブ2K解像度出力の経済的実現可能性を支える基盤技術となっています。

また、マルチモーダルトランスフォーマーアーキテクチャである「H3-Omni Transformer」は、テキスト、画像、音声を処理・統合し、「文脈理解」を提供します。このアーキテクチャは、33.1Bの密な単一ストリームオムニトランスフォーマーであり、Qwen3-VL-32Bテキストエンコーダーを搭載しています。Minimaxは、タスクの一般化を優先し、かつて大きなアーキテクチャ的利点をもたらしたHailuo-02アーキテクチャを意図的に採用しないという設計哲学を貫いています。

H3の2K解像度出力は、従来の専用の超解像度モジュールを使用せず、「In-Context Regeneration」という手法によって実現されています。この技術は、モデルがその低解像度出力を文脈内で自己再生することを可能にし、元のマルチモーダルな文脈を再度利用して高解像度出力を生成します。これにより、従来の超解像では復元が困難だった小さなテキストや微細なディテールを保持し、出力の一貫性、事実の正確性、全体的な品質を向上させます。

トレーニングアーキテクチャにおいては、理解と生成のワークロードを分離し、それぞれのハードウェア利用を最適化することで、エンドツーエンドのトレーニングスループットを約30%向上させることが報告されています。ローカル実行の観点からは、H3-Baseモデル(768p出力)はローカルで動作可能ですが、2K解像度を実現するContext-IRとRegenerate-2Kモジュールはリリース時点ではAPI専用です。ローカル環境でH3のオープンウェイト(bf16チェックポイント)を実行する場合、L40SのようなGPUで、約64GBのシステムRAMと、最大で38.9GBのVRAM(960x544で5クリップの場合)が推奨されます。特に、32Bのテキストエンコーダーがデノイザーと並行して動作する際に19.5GBのメモリを消費するため、エンコードフェーズとデノイズフェーズを分離し、エンコーダーをCPUに退避させることで、レンダリング時間を大幅に短縮できることが示されています。

性能評価と市場での位置づけ

Minimax H3は、その発表以来、AIビデオ生成市場で大きな注目を集めています。独立系評価機関であるArtificial Analysisの評価によると、H3はビデオ編集機能において世界で第1位にランク付けされ、テキスト-to-ビデオでは第2位、画像-to-ビデオでは第3位を獲得しています。これらのベンチマーク結果は、MinimaxがH3をビデオ生成だけでなく、マルチモーダルなコンテンツ編集と制御においても強力なツールとして位置付けていることを示しています。

価格面では、H3のAPIは、1秒あたり約0.13米ドル(15秒の2K動画で約1.95米ドル)と設定されており、これは競合するSeedance 2.5の約12分の1のコストに相当します。この競争力のある価格設定は、H3が提供する高性能と組み合わさり、商用利用における大きなメリットとなります。

Minimaxは、H3のモデルウェイトをオープンソース化する意向を示していますが、現時点ではAPIを通じて利用可能です。ただし、AI規制や著作権に関する懸念から、英国、EU、米国、韓国などの主要市場ではリリース時点で利用できない制限があります。これは、AI生成コンテンツの法的・倫理的側面が進化する中で、グローバル展開における課題を浮き彫りにしています。

H3は、GoogleのVeoやOpenAIのツール、さらにはSynthesia、Kling 3.0など、市場の主要な競合モデルに対抗しうる存在として位置づけられています。特に、ネイティブオーディオと2K解像度を統合した唯一のモデルであり、既存のビデオスタックが複数の専門モデルに分かれていた機能を一つの事前学習パラダイムに統合した点が、その競争優位性となっています。

開発者・エンジニア視点での考察

  1. 高解像度生成における効率化のパラダイムシフト: H3-VAEによる効率的なシーケンス長圧縮と、In-Context Regenerationによる超解像モジュールの代替は、高解像度コンテンツ生成における計算リソースとコストの課題に対する革新的な解決策を提示しています。従来の超解像技術が抱える詳細復元やアーティファクトの問題を、ベースモデルの生成能力を再利用することで克服するアプローチは、将来の高忠実度AI生成の標準となる可能性を秘めています。

  2. マルチモーダルワークロード最適化の設計指針: 理解(understanding)と生成(generation)のワークロードを分離し、それぞれにハードウェア利用を最適化するH3のトレーニングアーキテクチャは、マルチモーダルモデルの多様で不均一な計算負荷を効率的に管理するための優れた設計戦略です。これによりトレーニングスループットが30%近く向上したという報告は、今後の大規模AIモデル開発において、リソース効率とスケーラビリティを最大化するための重要な指針となるでしょう。

  3. オープンウェイトとAPIエコシステムの戦略的検討: MinimaxがH3のモデルウェイトのオープンソース化を計画しつつも、フル2K機能がAPI依存であるという二層構造は、開発者にとって戦略的な検討を促します。オープンウェイトはカスタマイズとローカルデプロイの可能性を広げますが、最先端の機能を利用するにはAPI統合が必須となります。データ主権や特定のハードウェア最適化を重視する開発者は、H3-Baseのローカル実行とAPIの連携戦略を慎重に計画する必要があります。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT