TAG / TOPIC

投機的デコーディング

「投機的デコーディング」に関するAIニュースと解説記事の一覧です。

02 STORIES

LATEST STORIES

投機的デコーディングの新着記事

タグ一覧

MODELS / 01

Liquid AI、視覚言語モデル向けDSparkドラフトを公開 — LFM2.5-VL-3Bのデコードを最大3.13倍高速化

Liquid AIは2026年9月24日、VLM「LFM2.5-VL-3B」向け投機的デコーディング用ドラフトモデル「LFM2.5-VL-DSpark」を公開した。4層・約280Mパラメータ(279.5M、+8.9%)の軽量ドラフトで、MLX(M5 Max)でデコード最大3.13倍・end-to-end最大2.62倍、SGLang(H100)でデコード最大2.66倍・end-to-end最大2.27倍を報告。6種のMMSpecタスクで評価。llama.cpp(GGUF)/MLX-VLM/SGLangにday-one対応。Hugging Faceで重みを公開(独自ライセンス)。

MODELS / 01

Liquid AI、LFM2.5向けDSparkドラフトを公開 — 推論を最大3.2倍高速化、品質はそのままにllama.cpp / SGLang対応

Liquid AIは2026年8月20日、Hugging FaceブログでLFM2.5向け投機的デコーディング「LFM2.5-DSpark」を公開した。LFM2.5-1.2B-Instruct/2.6B/8B-A1B向けに各約300Mパラメータ(5層・ブロック9)のアテンション特化ドラフトを提供。DFlash並列バックボーン+マルコフ逐次ヘッド+信頼度スケジュール検証のDSpark構成を採用。llama.cpp(M4 Max MacBook Pro・Metal・FP16 GGUF)とSGLang(H100・BF16)で評価し、H100で最大3.18倍、M4 Maxで最大2.87倍のスループット向上を報告。greedyではターゲットと同一出力のため精度不変、2.6BではBFCL相当の多ツール呼び出しレイテンシを平均57%削減。llama.cppとSGLangにday-one対応。