Liquid AIは、2026年8月20日にLFM2.5ファミリーの3つのモデル(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)向けにDSparkドラフトモデルチェックポイントを公開しました。これは、既存のターゲットモデルに投機的デコーディングパスを追加することで、デコーディング速度を大幅に向上させるものです(出典)。
DSparkとは—投機的デコーディングで高速化を実現
DSparkは、投機的デコーディングと呼ばれる技術を実装しています。これは、比較的小さなドラフトモデルが候補トークンを提案し、それを大きなターゲットモデルが一括で検証することで、デコーディングプロセスを高速化する手法です(出典)。
LFM2.5の各ドラフトモデルは約300Mパラメータを持ち、5つの全アテンションレイヤーを基盤としています。このドラフトモデルが9つの候補トークンブロックを提案し、ターゲットモデルがそれを単一のフォワードパスで検証します。これにより、メモリ使用量はわずかに増加するものの、デコーディング速度が劇的に向上します(出典)。
DSparkは、モデル出力を変えることなく、デコーディング速度をH100で最大3.18倍、M4 Max MacBook Proで最大2.87倍高速化します。
具体的には、DSparkは以下の3つの要素を組み合わせています(出典、出典)。
- DFlash-style parallel backbone: ターゲットモデルのコンテキスト特徴に条件付けされた並列バックボーンが、すべてのドラフトトークンに対して隠れ状態を1回のフォワードパスで生成します。
- Lightweight sequential head: マークオフ連鎖としてモデル化された軽量なシーケンシャルヘッドが、トークン間の依存関係を回復し、後続のブロック位置での受け入れ率を高めます。
- Confidence-scheduled verifier: 各トークンの生存確率を予測し、検証コストが節約分を上回る場合に低信頼度のサフィックスをプルーニングします。
これにより、推論のボトルネックとなっていたメモリバウンドなデコードフェーズの課題が解決されると感じます。特に、DRAMからSRAMへのウェイトストリーミングによるレイテンシが短縮されるのは、ローカル環境でLLMを動かす上で非常に大きいのではないでしょうか。
利用可能性と適用分野
DSparkドラフトモデルは、自己ホスティング環境での利用を前提としています。ウェイトはSafetensorsおよびGGUF形式で提供され、Hugging Faceでホストされている推論プロバイダーではまだサポートされていません。利用には、DSparkをサポートするSGLangまたはllama.cppのビルドが必要です(出典)。
LFMオープンライセンスv1.0の下では、年間収益が1,000万ドル未満の企業は無料での商用利用が可能です。これは、私のような個人開発者やスタートアップ、中小企業にとって非常に魅力的な条件です。一方で、それ以上の大企業はLiquid AIに直接商用ライセンスについて問い合わせる必要があります(出典)。
この技術は、以下のような幅広い分野とアプリケーションでの活用が期待されます(出典)。
- 企業レベル: インディーズ開発者、スタートアップ、中小企業
- 業界: 開発者ツール、ローカルで実行されるコンシューマーアプリ、ロボット工学および組み込みシステム、オンプレミスまたはオンデバイスでデータを保持するヘルスケア、金融、防衛分野
- アプリケーション: ローカルコーディングアシスタント、ツール呼び出し前に推論を行うオンデバイスエージェント、バッチサイズが1のシングルユーザーチャット、ノートPCクラスのハードウェアでのオフラインコパイロット
自分の個人プロダクトでも、オンデバイスエージェントやローカルコーディングアシスタントといった分野で活用できそうな予感がします。特に、RTX 3090を搭載した自作PCでローカルLLMを動かしている身としては、推論速度の向上は非常に喜ばしいニュースです。
測定結果とパフォーマンス
Liquid AIは、H100 GPUおよびM4 Max MacBook Proでの測定結果を報告しています。BF16でのスループットはSGLang経由で測定されました(出典)。
| 項目 | H100(GPU) | M4 Max MacBook Pro(オンデバイス) |
|---|---|---|
| 最大スループット向上 | 3.18倍 | 2.87倍 |
| LFM2.5-2.6Bの関数呼び出しレイテンシ削減 | - | 平均57%削減 |
この結果は、GPUだけでなくオンデバイス環境でも顕著なパフォーマンス向上があることを示しており、特にモバイルデバイスや組み込みシステムでのLLM活用に大きな道を開くものと感じます。関数呼び出しのレイテンシが57%削減されるのは、エージェントAIの応答性向上に直結するため、非常に画期的ではないでしょうか(出典)。