LFM2.5エンコーダ:CPUでの高速・長文脈推論を実現するハイブリッドAIモデル
LFM2.5ハイブリッドアーキテクチャの革新
Liquid AIは、CPU上での高速かつ長文脈推論を可能にする、新しいハイブリッドAIモデルファミリー「LFM2.5」を発表しました。このモデルは、既存のLFM2アーキテクチャを基盤とし、オンデバイス展開に特化して設計されています。LFM2.5の中核にあるのは、標準的なTransformerモデルのようにテキスト全体をスキャンして広範囲の単語間の関係性を捉える部分と、テキストを順次処理しながらコンパクトな記憶を保持する部分を組み合わせた「ハイブリッド」デザインです。この革新的なアプローチにより、LFM2.5は強力なローカル理解力と優れた長距離記憶能力を両立させ、特にCPUやNPUでの高い効率性を実現しています。
技術的な詳細としては、LFM2.5モデルは「ダブルゲートLIV畳み込みブロック(double-gated LIV convolution blocks)」と「GQAブロック(GQA blocks)」を組み合わせたレイヤー構造を採用しています。例えば、LFM2.5-350Mモデルは10個のダブルゲートLIV畳み込みブロックと6個のGQAブロックで構成されています。このアーキテクチャは、限られたリソース下でも高い性能を発揮できるよう最適化されており、事前学習においては10兆トークンから28兆トークンへと大幅に拡張され、強化学習を用いたポストトレーニングパイプラインも強化されています。
卓越したパフォーマンスとエッジデバイス最適化
LFM2.5モデルファミリーは、そのサイズクラスにおいてCPUとGPUの両方で比類のないスループットと最速の推論速度を誇ります。具体的に、LFM2.5-350MモデルはAMD CPUで313トークン/秒、Snapdragon Gen4で188トークン/秒のデコード速度を達成しています。さらに小型のLFM2.5-230Mは、Galaxy S25 Ultraで213トークン/秒、Raspberry Pi 5で42トークン/秒という驚異的な速度で動作します。
長文脈処理能力もLFM2.5の大きな特徴であり、多くのモデルで32,768トークンものコンテキスト長をサポートし、LFM2.5-8B-A1Bなどの一部のバリアントでは最大128,000トークンという非常に長いコンテキストに対応しています。 また、LFM2.5-350Mは1GB未満のメモリフットプリントで動作するなど、低いメモリ使用量も大きな利点です。これらの特性により、LFM2.5はオンデバイスAI、ローカルコパイロット、車載アシスタント、ローカル生産性ワークフローといったエッジデバイスでの利用に理想的であり、制約のあるハードウェア環境でも高性能なAIを実現します。
開発者エコシステムと多様なモデル展開
LFM2.5モデルファミリーは、230M、350M、1.2B、8Bといった様々なパラメータサイズで提供されており、各モデルはベース、インストラクト、ビジョン・言語、オーディオといった多様なバリアントを含んでいます。例えば、LFM2.5-8B-A1Bは8.3Bの総パラメータと1.5Bのアクティブパラメータを持ちます。これらのモデルはすべてオープンウェイトで、Hugging FaceやLEAPを通じて利用可能です。
開発者にとって特に重要なのは、主要な推論フレームワークに対する「Day-one」サポートです。LFM2.5は、llama.cpp(GGUF形式)、MLX、vLLM、SGLang、ONNX Runtime、OpenVINOといった幅広いプラットフォームとツールキットに対応しており、クロスプラットフォームでの展開やハードウェアアクセラレーションを容易にします。これにより、開発者は既存のインフラやワークフローにシームレスに統合し、CPUからGPU、NPUまで多様な環境でLFM2.5の恩恵を受けることができます。また、英語だけでなく、日本語、アラビア語、中国語、フランス語、ドイツ語、イタリア語、韓国語、ポルトガル語、スペイン語といった多言語をサポートしている点も、グローバルなアプリケーション開発において大きな強みとなります。
開発者・エンジニア視点での考察
-
リソース制約下での高性能AIアプリケーション開発の加速: LFM2.5のハイブリッドアーキテクチャとCPU最適化により、組み込みシステムやモバイルデバイスなどのリソースが限られた環境でも、大規模モデルに匹敵する応答速度と長文脈処理能力を持つAIアプリケーションを開発できます。これは、エッジAIの普及と新たなユースケース創出に大きく貢献します。
-
既存の推論エコシステムへのシームレスな統合:
llama.cpp、MLX、ONNX Runtimeなどの主要な推論フレームワークへの「Day-one」サポートは、開発者が既存のツールチェーンやワークフローを大きく変更することなくLFM2.5モデルを容易に導入・展開できることを意味します。これにより、導入障壁が低減され、開発サイクルが短縮されます。 -
多言語・マルチモーダル対応によるグローバル市場への展開: 日本語を含む多言語対応およびVision-Language、Audioモデルの提供は、開発者が単一のモデルファミリーを基盤として、地域に特化した高機能なAIアシスタントやマルチモーダルアプリケーションを効率的に構築できる機会を提供します。これにより、グローバル市場におけるAI製品の競争力が高まります。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


