IMAGE: AI生成ビジュアル
MODELS / MODELS
Liquid AI、視覚言語モデル向けDSparkドラフトを公開 — LFM2.5-VL-3Bのデコードを最大3.13倍高速化
Liquid AIは2026年9月24日、視覚言語モデルLFM2.5-VL-3B向けの投機的デコーディング用ドラフト「LFM2.5-VL-DSpark」を公開した。約280Mパラメータ(+8.9%)の追加で、出力品質を変えずにデコードを最大3.13倍(Appleシリコン)・2.66倍(H100)高速化するとしている。llama.cpp/MLX-VLM/SGLangに初日対応。
Liquid AIは2026年9月24日、視覚言語モデル(VLM)LFM2.5-VL-3B向けの投機的デコーディング用ドラフトモデルLFM2.5-VL-DSparkを公開した。8月に公開したテキスト系LFM向けDSparkに続くもので、今回は視覚言語モデル用として初のドラフトとなる。約280Mパラメータの小さな追加コストで、出力品質を変えずにデコードを大幅高速化できるとしている。重みはHugging Faceで公開され、llama.cpp/MLX-VLM/SGLangが初日から対応する。
仕組み — テキストと画像を区別しない隠れ状態ベースのドラフト
DSparkの考え方はテキスト向けと共通だ。ターゲットモデルの各層の隠れ状態を条件に、軽量ドラフトが次のkトークンを推測し、ターゲットが一括検証する。ドラフトの視点では入力モダリティは無関係で、隠れ層に届く段階ではテキストも画像パッチも同じ次元のテンソルとして表されるため、テキスト用とまったく同じ推論アルゴリズムをVLMに適用できるという。
- ドラフト構成: 簡素なアテンション特化型・4層、推論時のブロックサイズは8または9を推奨(ハードウェア依存)
- 学習: 視覚言語SFTデータの混合(提供予定ワークロードに重み付け)で10エポック学習。層数・ブロックサイズはアブレーションで選定
- サイズ: 合計279.5Mパラメータで、デプロイ時のパラメータ増はわずか8.9%(埋め込み・LMヘッドはターゲットと共有)
- 学習基盤: すべてのアブレーションと学習はAMDハードウェア上でLiquid AIの学習フレームワークにより実行
性能 — オンデバイス最大3.13倍、H100で最大2.66倍のデコード高速化
評価は一般VQA・テキストVQA・画像キャプション・チャートVQA・複雑な推論・多ターン会話という6種の多様な視覚タスク(MMSpecベンチマーク準拠)で実施。計測基盤は同社の公開デバイス性能データと同じPipetteで、エンコーダーと言語バックボーンはいずれも16ビット処理(量子化モデルの高速化は今回の対象外)とした。ベンダー公称値として報告された数値は次の通りだ。
- オンデバイス(MLX-VLM/M5 Max MacBook Pro): タスク別にデコード2.30〜3.13倍、end-to-endで1.56〜2.62倍
- オンデバイス(llama.cpp/M3 Ultra、FP16): デコード1.57〜2.14倍、end-to-endで1.30〜1.77倍
- GPU(SGLang/H100 80GB単体、BF16): デコード2.04〜2.66倍、end-to-endで1.64〜2.27倍
- 受理率: 検証1回あたり約3.2〜4.5トークンで、ハードウェアやランタイムよりもドラフトとワークロードに依存
限界 — 高速化するのはデコードのみ、温度上昇で受理率は低下
Liquid AIは限界も明示している。投機的デコーディングが速くするのはデコードだけで、視覚エンコードやprefillは対象外だ。VLMでは画像が vision encoder を通り、言語バックボーンが数百の視覚トークンを処理するため、特に計算資源の少ないエッジデバイスではprefillが壁時間の大半を占める。デコード高速化が大きくても、end-to-endの改善は控えめになる場合があるとしている。
- 温度の影響: 温度を上げると確率質量が下位候補に広がり、ドラフトとターゲットの不一致が増えて受理率とスループットが低下する
- 量子化: 量子化モデルの高速化は今回のリリースの対象外
- 実験的扱い: 今回はexperimentalなドラフトモデルという位置づけ
利用面では、ドラフトは LiquidAI/LFM2.5-VL-3B-DSpark とGGUF版(LFM2.5-VL-3B-DSpark-GGUF)がHugging Faceで公開されている。ただしライセンスは**other(独自ライセンス)**扱いのため、商用利用などの前にリポジトリ同梱のLICENSEの確認が必要だ。独立した第三者評価はまだ確認できておらず、上記の数値はいずれもベンダー公称値として扱うべきである。
出典:
出典: