liquid.aiがLFM2.5-VL-3Bを発表:エッジAI向け高速かつ高性能なビジョン言語モデル


ADVERTISEMENT

LFM2.5-VL-3Bの概要と主要機能

Liquid AIは、エッジデバイス向けに最適化された最新のビジョン言語モデル(VLM)である「LFM2.5-VL-3B」をリリースしました。このモデルは31億のパラメータを持ち、従来のLFM2-VL-3Bを基盤としつつ、画面/UI理解、関数呼び出し、グラウンディング、およびマルチ画像入力の4つの主要な側面で大幅な改善が施されています。LFM2.5-VL-3Bは、推論プロセスを介さずに直接応答する「非推論型」モデルとして設計されており、リアルタイムおよびオンデバイスアプリケーションで極めて低いレイテンシを実現します。

特に、デジタル画面全体(モバイル、ウェブ、デスクトップ)に対する強力な理解力を持ち、ScreenSpot-v2ベンチマークで80.7という高いスコアを記録しています。これは、より大規模なモデルであるGemma-4-E4B (51.2) やQwen 3.5 4B (78.5) を大きく上回り、InternVL-3.5-4B (84.1) に迫る性能です。また、テキスト入力とビジョン-テキスト入力の両方において、ツール使用と関数呼び出し能力が大幅に強化されており、ToolSandboxのスコアは26.4から59.5へと倍増し、BFCL v4も20.5から32.5に向上しています。

技術的詳細とパフォーマンスベンチマーク

LFM2.5-VL-3Bは、同社が以前リリースしたLFM2.5-2.6Bテキストモデルと同じ事前学習済み基盤上に構築され、SigLIP2 400M NaFlexエンコーダを統合したアーキテクチャを採用しています。このモデルは3.3GB未満のメモリを使用するため、リソースが限られたエッジ環境での展開に適しています。

評価ベンチマークでは、合成グラウンディングデータのスケーリングにより、グラウンディング性能が顕著に向上しました。RefCOCO precision@1は57.1から87.9へと30ポイントの向上を見せています。マルチ画像入力に関しても、BLINKが50.2から61.5に、MUIRBenchが34.9から58.3に改善し、複数の画像を横断するより高度な推論が可能になっています。さらに、RealWorldQAで73.1、TextVQAで84.3を達成しており、広範な視覚認識タスクで優れた性能を発揮します。

高速推論と多様なデプロイメント

LFM2.5-VL-3Bは、高速で応答性の高い推論のために設計されており、特にGPU環境でその能力を発揮します。単一のNVIDIA H100 SXM5 GPU上では、マルチフレーム入力(例:5フレームビデオクリップ)に対して約34ミリ秒という非常に短い最初のトークン出力時間を実現しています。これは、Gemmaモデルが約200ミリ秒かかるのと比較して、大幅な高速化です。高負荷時においては、単一のH100で毎秒約11,000トークンの出力スループットに達し、1日あたり約10億トークンを処理できます。

オンデバイス推論においても、LFM2.5-VL-3Bはその効率性を示しています。Apple M5 Maxでは毎秒228トークン、AMD Ryzen AI Max+ 395では毎秒116トークン、さらにはGalaxy S26 Ultraスマートフォンでも毎秒20トークンをデコード可能であり、ラップトップからスマートフォンまで、幅広いデバイス上での実行が確認されています。このモデルは、NVIDIA、AMD、Apple、Qualcommといった多様なプロセッサをサポートし、llama.cpp、MLX、vLLM、SGLang、ONNXなどの主要なフレームワークに対応しているため、開発者は柔軟なデプロイメントが可能です。

多言語対応と広範な応用可能性

LFM2.5-VL-3Bは、英語だけでなく、日本語、アラビア語、中国語、フランス語、ドイツ語、イタリア語、韓国語、ポルトガル語、スペイン語、ベトナム語、タイ語、インドネシア語、ヒンディー語、ロシア語、ポーランド語を含む多数の言語をサポートしています。この多言語対応は、グローバルな市場での幅広いアプリケーション開発に貢献します。

具体的な応用例としては、UI認識、文書OCR、グラウンディングタスク、および迅速な応答が求められるマルチ画像処理などが挙げられます。ウェブ、モバイル、デスクトップ環境での画面理解能力は、デジタルアシスタント、アクセシビリティツール、自動テストなどの分野で新たな可能性を切り開きます。さらに、文書のOCRとレイアウト理解能力は、データ抽出、インフォグラフィック分析、知的文書処理における効率を大幅に向上させることが期待されます。

開発者・エンジニア視点での考察

  1. エッジデバイスへの最適化と広範なフレームワークサポート: LFM2.5-VL-3Bは、3.3GB未満のメモリフットプリントでApple M5 MaxやAMD Ryzen AI Max+ 395といったオンデバイス環境で毎秒100トークン以上の高速推論を可能にし、さらにはGalaxy S26 Ultraでも動作します。加えて、llama.cppMLXvLLMSGLangONNXなど、多岐にわたるオープンソース推論フレームワークをサポートしているため、開発者は特定のハードウェアや既存のインフラストラクチャに合わせて、高性能なVLMを容易に統合し、展開することができます。

  2. 関数呼び出しとグラウンディング能力の劇的な向上: ToolSandboxスコアが26.4から59.5に、RefCOCO precision@1が57.1から87.9へと大幅に改善したことは、ビジョン入力に基づいたより正確かつ複雑なツール利用や、現実世界におけるオブジェクトの精密な位置特定と参照を可能にします。これにより、開発者は、視覚情報を基盤とした高度なエージェントシステム、ロボティクス、拡張現実(AR)アプリケーションなど、より洗練されたインタラクションモデルを構築する新たな道が開かれます。

  3. 非推論型アーキテクチャによる超低レイテンシの実現: モデルが直接的に応答する「非推論型」設計は、特にマルチ画像入力のような計算負荷の高いシナリオにおいて、最初のトークン出力までの時間をH100 GPUで約34ミリ秒にまで短縮します。この極めて低いレイテンシは、リアルタイム性が不可欠なインタラクティブなUIアシスタント、ライブ映像解析、瞬時の画像検索など、ユーザーエクスペリエンスが速度に大きく依存するアプリケーションにおいて、その応答性を劇的に向上させるための重要な基盤となります。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT