LFM2.5-VL-DSpark:ビジョン言語モデル推論の飛躍的加速を実現する投機的デコーディング技術


ADVERTISEMENT

LFM2.5-VL-DSparkの概要と投機的デコーディング技術

Liquid AIは、同社のビジョン言語モデル(VLM)であるLFM2.5-VL-3B向けに、実験的なDSparkドラフトモデルを公開しました。このLFM2.5-VL-DSparkは、投機的デコーディングパスを導入することで、最小限のメモリ増加と引き換えに、出力品質を損なうことなく推論速度を大幅に向上させることを目的としています。特に、LFM2.5-VL-DSparkはデバイス上で最大3.13倍、H100 GPU上では最大2.66倍のデコード速度向上を実現し、エンドツーエンドではそれぞれ最大2.62倍、2.27倍のゲインを達成しています。

投機的デコーディングは、従来のLLM推論のデコードフェーズがDRAMからSRAMへの重みストリーミングに起因するメモリバウンドな処理であるという課題に対処するアプローチです。この技術は、軽量なドラフトモデルが候補トークンを生成し、ターゲットモデルがそれらを1回のフォワードパスでまとめて検証することで機能します。これにより、重みロードのコストを複数のトークン間で共有し、実効スループットを劇的に高めます。 DSparkは、DFlashスタイルの並列バックボーン、隣接トークン間の依存関係を高める軽量なシーケンシャルヘッド、および信頼度に応じたベリファイアという3つの主要コンポーネントを組み合わせています。

アーキテクチャ詳細と性能ベンチマーク

LFM2.5-VL-DSparkのビジョン向けドラフターは、テキストベースのLFM2.5-DSparkドラフターと同じアーキテクチャを採用しています。これは、ターゲットモデルの隠れ状態を特定のタップ層で捕捉し、それらを条件としてk個の候補トークンのブロックをドラフトします。画像パッチとテキストトークンは、これらの層の前に共通の表現空間に投影されるため、ドラフターは入力モダリティに関係なく、同一次元の隠れ状態ベクトルで動作します。このため、推論アルゴリズムはテキストモデルから変更されていません。

LFM2.5-VL-DSparkドラフターのパラメータは約280Mであり、これは3Bのターゲットモデルに対してわずか8.9%のパラメータ増加に留まります。アーキテクチャは4層のアテンションオンリードラフターであり、ブロックサイズは9です。トレーニングはビジョン言語SFTデータの混合で行われ、モデルが対応すると予想されるワークロードに重みが置かれました。

性能に関して、LFM2.5-DSpark(テキストモデル向け)は、H100 GPUで最大3.18倍、M4 Max MacBook Proのようなオンデバイス環境で最大2.87倍のスループット向上を達成しています。 特にLFM2.5-2.6Bモデルでは、多機能シナリオにおけるファンクションコールレイテンシを平均で57%削減できることが報告されています。 重要な点として、投機的デコーディングは、生成されるシーケンスがベースラインのグリーディデコーディングと完全に一致するように設計されており、ベンチマーク精度(pass@1やexact match)は変化しません。

主要なユースケースと開発者エコシステム

LFM2.5-VL-DSparkは、その高速化と効率性により、オンデバイスでのエージェント推論、ローカルコーディングアシスタント、シングルユーザーチャット、ラップトップクラスのハードウェア上でのオフラインコパイロットなど、幅広いアプリケーションへの道を拓きます。 特に、LFM2.5シリーズはスマートフォンやノートPCなど、計算能力が限られたデバイス上での動作を想定して設計されたオープンモデル群であり、今回の高速化はエッジAIの普及をさらに加速させるでしょう。

開発者にとっての重要な点は、LFM2.5-DSparkとそのVLM対応版が主要なオープンソース推論スタックとの「Day-oneサポート」を提供していることです。具体的には、llama.cpp、MLX-VLM、SGLangとのLFM互換DSpark統合がオープンソース化されています。 モデルの重みはSafetensorsおよびGGUF形式でHugging Faceを通じて提供されており、開発者は容易に利用を開始できます。 ライセンスに関しては、LFM Open License v1.0の下で、年間収益が1,000万ドル未満の企業は商用利用が無料で可能であり、インディー開発者、スタートアップ、中小企業が対象となります。

開発者・エンジニア視点での考察

  1. オンデバイス・エージェントAIの実現可能性拡大: LFM2.5-VL-DSparkによる大幅な推論速度向上は、ネットワーク遅延の制約を受けやすいエージェント型アプリケーションにおいて、オンデバイスでのリアルタイム応答性を飛躍的に高めます。特に、ファンクションコールのような複雑な推論を伴うタスクでのレイテンシ削減は、ユーザー体験を向上させ、より複雑なローカルエージェントの開発を促進するでしょう。

  2. 既存推論スタックとの互換性による導入障壁の低減: llama.cppやSGLang、MLX-VLMといった広く利用されているオープンソース推論フレームワークへのDay-oneサポートは、開発者が既存のワークフローやインフラストラクチャを大幅に変更することなく、LFM2.5-VL-DSparkを迅速に採用できることを意味します。これにより、研究から実用化までの期間が短縮され、エッジデバイス向けマルチモーダルAIの普及が加速すると期待されます。

  3. 品質維持とメモリ効率の両立によるモデル選定の柔軟性: 出力品質を一切損なうことなく推論を高速化し、かつドラフターがターゲットモデルに対してわずかなメモリ増加で済むという特性は、性能とリソース制約のバランスを考慮する開発者にとって非常に魅力的です。これにより、計算リソースの限られたエッジデバイスや組み込みシステムにおいても、高品質なビジョン言語モデルを導入しやすくなり、モデル選定の柔軟性が向上します。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT