LFM2.5-DSparkによる推論加速:最大3.2倍高速なオンデバイスAIの実現
Liquid AIは、同社のLFM2.5モデルファミリー向けに「DSpark」ドラフトモデルチェックポイントをリリースし、大規模言語モデル(LLM)の推論速度を大幅に向上させました。この技術により、既存の出力品質を維持したまま、GPUで最大3.18倍、オンデバイスで最大2.87倍のスループット改善が報告されています。これは、特にエッジAIやオンデバイスエージェントの展開において、新たな可能性を開く画期的な進歩です。
DSparkによる推測デコーディングの仕組みとその革新性
LLMの推論プロセスにおけるデコードフェーズは、伝統的にメモリ律速型であり、レイテンシの大部分はDRAMからSRAMへの重みのストリーミングに起因します。推測デコーディングは、この課題に対処するための効果的なアプローチであり、軽量なドラフトモデルを用いて候補トークンを生成し、その後、ターゲットモデルがこれらのトークンすべてを単一のフォワードパスで検証することで、重みロードのコストを検証対象の全トークンに分散させます。
DSparkは、従来の推測デコーディング手法をさらに進化させたもので、以下の3つの主要なコンポーネントを組み合わせています:
-
DFlashスタイルの並列バックボーン: ターゲットモデルのコンテキスト特徴に基づいて、すべてのドラフトトークンの隠れ状態を単一のフォワードパスで生成します。これにより、並列処理能力が向上します。
-
軽量なシーケンシャルヘッド: 隣接トークン間の依存関係をマルコフ連鎖としてモデル化し、ブロック内の後続の位置における受理率の低下を防ぎます。
-
信頼度スケジュールされた検証器: 各トークンの生存確率を予測し、検証コストが節約分を上回る場合に、信頼度の低い接尾辞を剪定します。これにより、無駄な計算を削減し、効率を最大化します。
これらのコンポーネントの組み合わせにより、DSparkは最小限のメモリ増加で推論速度を大幅に向上させながら、ターゲットモデル単独での貪欲デコーディングと同じ出力品質を保証します。
LFM2.5モデルファミリーにおけるパフォーマンスベンチマーク
Liquid AIは、LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1Bの3つのLFM2.5モデルに対してDSparkドラフトモデルを提供しています。これらのドラフトモデルは、元のターゲットモデルに約3億パラメータのオーバーヘッドを追加しますが、その見返りとして顕著なスループット向上が得られます。
ベンチマーク結果は以下の通りです:
- GPU (H100): LFM2.5-8B-A1Bモデルにおいて、MATH500データセットで最高の3.18倍のスループット向上が観測されました (428 tok/sから1,362 tok/sへ)。
- オンデバイス (M4 Max MacBook): LFM2.5-1.2B-Instructモデルにおいて、HumanEvalデータセットで最高の2.87倍の速度向上が報告されています (136 tok/sから389 tok/sへ)。
- LFM2.5-2.6Bモデル: 5つのデータセットにわたる平均的な速度向上は、H100で2.67倍 (323 tok/sから864 tok/sへ)、M4 Max MacBookで2.27倍 (61 tok/sから139 tok/sへ) でした。
- 機能呼び出しレイテンシ: LFM2.5-2.6Bの場合、機能呼び出しのレイテンシが平均で57%削減されました。これは、エージェントワークフローにおけるインタラクティブ性の向上に大きく貢献します。
ドラフトモデルは、SFT、チャット、コード、関数呼び出しデータを含む大規模かつ多様なデータミックスで15エポック学習され、最低損失ではなく最高受理率のエポックが選択されました。DSpark統合はllama.cppとSGLangにオープンソースで提供されており、これらのエコシステム内での開発と展開が容易になります。
開発者・エンジニア視点での考察
-
エッジデバイスにおけるLLMエージェントの実現可能性拡大: DSparkによる劇的な推論速度向上と機能呼び出しレイテンシの削減は、スマートフォンや組み込みデバイスのようなリソース制約のある環境でも、複雑なエージェントワークフローやインタラクティブなAIアプリケーションをより実用的にします。開発者は、クラウド依存度を低減し、プライベートで高速なオンデバイスAI体験を設計できるようになります。
-
既存のエコシステムとのシームレスな統合と採用促進:
llama.cppやSGLangといった広く利用されているLLM推論フレームワークへのDay-oneサポートは、開発者にとって大きな利点です。既存のワークフローやツールセットを大きく変更することなく、DSparkの推論最適化技術を容易に導入し、既存のアプリケーションのパフォーマンスを向上させることが可能になります。 -
品質を犠牲にしない性能最適化戦略の提供: 推測デコーディングの「正確性保証」は、DSparkが高速化を実現しつつも、ターゲットモデル単独で生成されるテキストと同一の出力品質を維持するという点で非常に重要です。これにより、開発者は推論速度とモデル出力の信頼性の間で妥協することなく、高性能なAIソリューションを安心して構築できます。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


