Liquid AIは、ビジョン言語モデル(VLM)であるLFM2.5-VL-3Bの推論を加速させるために設計された、実験的なDSparkドラフトモデルをリリースしました。このドラフトモデルは投機的デコーディング(speculative decoding)を利用しています。これは、より小さく高速なモデルを使用して候補となるトークンを提案し、それをより大きなターゲットモデルが検証するという手法です。このアプローチにより、メモリ使用量の増加を最小限に抑えつつ、大幅な高速化を実現します。
モデル発表Liquid AIDSparkLFM2.5-VL-3B
Liquid AIがLFM2.5-VL-3Bの推論を加速するDSpark Draftモデルをリリース
この記事は翻訳です。 原文を読む
DSparkビジョンドラフターは、テキストベースのLFM2.5-DSparkモデルと同じアーキテクチャを採用しています。ターゲットモデルの固定されたレイヤーセットから隠れ状態(hidden states)を取得し、入力モダリティに関係なく同一の次元数を持つ隠れ状態ベクトルに対して動作します。結果として生成されたドラフターは、約280百万のパラメータを持ち、デプロイされたモデルのパラメータ数を8.9%増加させます。
パフォーマンスの測定結果では、さまざまなハードウェア構成において大幅な改善が示されています。Appleシリコンを使用したオンデバイス推論では、M5 Maxで2.30xから3.13x、M3 Ultraで1.57xから2.14xのデコーディング速度の向上が確認されました。NVIDIA H100を使用したGPU推論では、ドラフターによって20.4xから2.66x高速なデコーディングが提供されます。
LFM2.5-VL-3B DSparkドラフトモデルは、llama.cpp、MLX-VLM、SGLangをリリース初日からサポートしています。このモデルは、Hugging FaceにてSafetensorsおよびGGUF形式で入手可能です。
出典
- Accelerating vision-language models with LFM2.5-VL-DSpark (Hugging Face Blog, 2026-09-24)