LFM2.5-VL-3B:エッジデバイス向けビジョン能力を革新する高速・高精度VLM


ADVERTISEMENT

LFM2.5-VL-3Bの概要とエッジAIへの最適化

Liquid AIは、エッジデバイス向けに設計された効率的かつ高性能なビジョン言語モデル(VLM)である「LFM2.5-VL-3B」を発表しました。この30億パラメータモデルは、既存のLFM2-VLシリーズ(450Mおよび1.6B)の最新かつ最も高性能なバージョンであり、LFM2-2.6Bバックボーンを基盤としています。LFM2.5-VL-3Bは、LFM2アーキテクチャの高速性を維持しつつ、より高い精度を要求されるアプリケーションをターゲットに開発されました。

このモデルは、スマートフォン、ラップトップ、車載システムなど、クラウド依存なしで動作するエッジ環境での展開を主眼に置いて構築されています。約1.9GB(Q8_0量子化時)のモデルサイズと、512x512までのネイティブ解像度処理能力により、リソースに制約のあるデバイス上での高速な応答と容易なデプロイメントを実現します。画像トークン数のバジェット調整やタイリングの切り替えといったユーザーコントロールを提供することで、推論時の速度と品質のトレードオフを開発者が細かく調整できるように設計されています。

革新的なハイブリッドアーキテクチャ

LFM2.5-VL-3Bの優れた性能は、その柔軟なハイブリッドアーキテクチャに由来します。このモデルは、言語処理を担当する「言語タワー」と、画像処理を行う「ビジョンタワー」、そして両者を接続する「コネクタ」で構成されています。

  • 言語タワー: LFM2-2.6Bバックボーンを基盤としており、10個のダブルゲート型短距離畳み込みブロックと6個のグループ化クエリアテンションブロックを組み合わせた、ハイブリッドな畳み込み+アテンション構造を採用しています。この設計により、純粋なトランスフォーマーアーキテクチャと比較して、より高速な推論と少ないメモリフットプリントを実現しています。LFM2-VLの全バリアントはデコーダーオンリーのLFM2バックボーンを維持しています。
  • ビジョンタワー: 400MパラメータのSigLIP2 NaFlexエンコーダを統合しています。このエンコーダの特長は、画像のネイティブアスペクト比を歪みなく保持し、最大512x512ピクセルの画像を自然な解像度で処理できる点です。より大きな画像については、非オーバーラップの512x512パッチに分割して処理し、サムネイルパスウェイがタイリング中にグローバルコンテキストを提供します。
  • コネクタ: 軽量なPixelUnshuffleとMLPで構成されるコネクタは、ビジョン表現のトークン数を削減し、視覚的な埋め込みをLFM2の言語トークンスペースに射影することで、統一されたマルチモーダル処理を可能にします。この効率的なトークンマッピングにより、モデルの再トレーニングなしでビジョントークンのバジェットを上限設定できるため、推論時のレイテンシを予測可能にします。

入力は、画像とテキストが混在した形式を受け付け、ChatMLライクなテンプレートを使用します。プロセッサは<image>センチネルをランタイムでエンコードされた画像トークンに置き換え、デフォルトのテキストコンテキスト長は32,768トークンです。

ベンチマーク性能と多言語対応

LFM2.5-VL-3Bは、オープンソースの評価において競争力のある結果を示しています。特に、MM-IFEvalで51.8%、RealWorldQAで71.4%という高いスコアを達成しました。また、単一および複数画像の理解、英語OCRにおいて強力な性能を発揮し、POPEベンチマークでは89.01%のスコアを記録し、低いハルシネーション率を実現しています。

言語のみの知識ベンチマークでは、そのバックボーンであるLFM2-2.6Bと同等のスコアを維持しており、GPQAで30%、MMLUで63%を達成しています。さらに、LFM2.5-VL-3Bは多言語能力を大幅に拡張し、英語だけでなく、日本語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、アラビア語、中国語、韓国語を含む広範な言語での視覚理解に対応しています。これにより、グローバルなエッジAIアプリケーションにおいて、より多様なユーザーと地域に対応できるようになります。

開発者・エンジニア視点での考察

  1. 効率的なリソース管理と品質の最適化: LFM2.5-VL-3Bは、推論時に画像トークンの最小/最大数やタイリングの利用を開発者が制御できる機能を提供します。これにより、限られたエッジデバイスのリソース内で、アプリケーションの要件に応じて推論速度と認識品質の最適なバランスを細かく調整することが可能となり、特定のユースケースに合わせた効率的なデプロイメントが実現できます。

  2. 多様な画像入力への柔軟な対応: SigLIP2 NaFlexエンコーダによるネイティブ解像度処理(最大512x512)と可変アスペクト比対応は、現実世界の多様な画像入力(監視カメラ、モバイルデバイス、センサーなど)に対して、前処理の複雑さを大幅に軽減します。これにより、開発者は画像の前処理パイプラインにかかる工数を削減し、よりロバストなビジョンアプリケーションを迅速に構築できます。

  3. マルチモーダルパイプラインへの容易な統合: ChatMLライクなテンプレートと、<image>センチネルを介した明確な画像入力インターフェースは、LFM2.5-VL-3Bを既存のマルチモーダル推論パイプラインやチャットベースのアプリケーションに容易に組み込めることを示唆しています。また、モデルカードで公開されている推論設定やベンチマーク再現の詳細情報は、開発者がモデルの挙動を理解し、自身のシステムに合わせた評価や統合を行う上で非常に有用です。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT