LFM2.5-2.6B:ローカルAIエージェント展開の新たな地平
ローカルAIエージェントの革新:LFM2.5-2.6Bの登場
Liquid AIは、完全にデバイス上で動作するエージェントAIモデル「LFM2.5-2.6B」を発表しました。このモデルは、わずか2.6Bパラメータという小型ながら、スマートフォンやCPU搭載デバイス上で高い応答性を保ちつつ、プランニング、ツール呼び出し、複数ステップタスク処理といったエージェントワークフローを駆動する能力を持っています。クラウドAPIに依存する従来のエージェントとは異なり、ローカルエージェントは無料の推論、低遅延、そしてリアルなプライバシー保護を実現します。トークンあたりのコストがなくなることで、開発者はローカルハードウェア上でエージェントを大規模に並列化し、追加コストなしで数百万のトークンを消費するバックグラウンドタスクを実行できるようになります。これにより、AIエージェントを時間や場所を選ばずに展開できる可能性が大きく広がります。Liquid AIは、LFM2.5-2.6Bのベースモデルとポストトレーニング済みモデルをHugging Faceで提供しており、ローカルでの実行とファインチューニングに関するドキュメントも公開しています。
LFM2.5-2.6Bの技術的詳細とトレーニングアプローチ
LFM2.5-2.6Bは、エージェントワークロード向けに特別にトレーニングされた2.6Bパラメータモデルであり、約34兆トークンという大規模なデータセットで事前学習されています。LFM2.5では非ラテン系スクリプトへの対応を強化するため、既存のトークナイザーを再トレーニングすることなく語彙を128Kに倍増させています。また、エージェントワークロードで必要とされる長い入力に対応するため、トレーニングの中間段階で128Kのコンテキスト拡張フェーズが設けられました。
LFM2.5-2.6B-Baseをエージェント機能を持つLFM2.5-2.6Bに変換するためのポストトレーニングは、4段階のパイプラインで構成されています。
-
教師ありファインチューニング (SFT): エージェントタスク、推論、ツール使用などの優先スキルに焦点を当てた2ラウンドのSFTが行われます.
-
教師特化 (Teacher Specialization): ドメインごとに専門教師をトレーニングします(数学、コード、ツール使用など).
-
マルチドメインオンポリシー蒸留 (MOPD): 専門教師の知識を単一の生徒モデルに蒸留します.
-
エージェント強化学習 (Agentic RL): 最も人気のあるエージェントハーネス内でモデルを直接トレーニングし、ツール、システムプロンプト、および対話パターンにモデルを露出させることで、様々なエージェント環境での信頼性を高めます.
LFM2.5は、効率的なLFM2アーキテクチャを基盤としており、Grouped Query Attention (GQA) ブロックと短い畳み込み層を交互に配置するハイブリッドアーキテクチャを採用していることが、その高速な推論速度とKVキャッシュ要件の削減に寄与しています。
卓越したパフォーマンス:ベンチマークと推論速度
LFM2.5-2.6Bは、そのサイズクラスにおいて最速のモデルとして際立っています。CPU推論では、M5 Maxで220トークン/秒、Ryzen AI Max+ 395で113トークン/秒のデコード速度を達成し、2.5GB未満のメモリ使用量に収まっています。スマートフォン上でも30トークン/秒を維持できるため、デバイス上で即座にプライベートなエージェントを実行することが可能です。GPU推論においては、高並列処理下で最大15K出力トークン/秒に達し、単一のH100 GPUで1日あたり約1.3Bトークンを処理できる能力を示しています。
ベンチマーク評価では、LFM2.5-2.6BはSTEM、指示追従、ツール使用、エージェントワークフローの各カテゴリで、自身の4倍近いサイズのモデルと競争力のある結果を示し、しばしばそれらを上回る性能を発揮しています。特に、指示追従とツール使用の各ベンチマークではトップの成績を収め、BFCLv4でQwen3.5-9Bにわずかに及ばないのみです。エージェントタスクでは、Gemmaモデル群を全体的に上回り、Qwenモデルとも拮抗しています。STEM分野ではAA Omniscienceでリードし、数学ではQwen3.5-9Bに次ぐ成績です。ただし、コーディング能力に関しては、より大型のモデルが優位性を保っています。
開発者・エンジニア視点での考察
-
コストフリーなエージェントワークフローの実現による開発パラダイムの変化: LFM2.5-2.6Bのオンデバイス展開は、トークン課金の制約から開発者を解放します。これにより、バックグラウンドでの常時稼働、大規模な並列処理、そして探索的なエージェントタスクなど、これまでコスト面で非現実的だった新しいアプリケーションの設計が可能になります。開発者は、クラウドAPIの費用を気にすることなく、より野心的なエージェントベースのシステムを構築できるようになるでしょう。
-
高プライバシー・低遅延要件アプリケーションへの適用拡大: 機密性の高いデータを取り扱う金融、医療、個人アシスタントなどの分野では、データがデバイス外に出ないオンデバイスエージェントの価値は計り知れません。また、リアルタイム性が求められるロボティクスやIoTエッジデバイスの制御において、クラウドへの往復を伴わないLFM2.5-2.6Bの低遅延推論は、応答性と信頼性を大幅に向上させる決定的な要素となります。
-
多様なハードウェア環境への展開と最適化の容易性: llama.cpp、MLX、vLLM、SGLang、ONNXといった主要な推論エコシステムを幅広くサポートしていることは、開発者が様々なエッジデバイス(スマートフォン、組み込みCPU、Apple Siliconなど)にLFM2.5-2.6Bを容易に展開できることを意味します。これにより、特定のハードウェアに縛られることなく、クロスプラットフォームでのAIエージェントソリューションの開発が加速されるでしょう。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


