IMAGE: AI生成ビジュアル
MODELS / MODEL WATCH
Liquid AI、エッジ向け最上位VLM「LFM2.5-VL-3B」を公開 — 画面理解・物体接地・ツール呼び出しを強化
SigLIP2 400M視覚エンコーダとLFM2.5-2.6Bテキストバックボーンを組み合わせ、約34Tトークンで事前学習。ScreenSpot-v2でデスクトップ78.7・モバイル81.2・Web 82.2、RefCOCO平均87.9を記録(Liquid AI公称値)。M5 Maxで228トークン/秒、約3GBのメモリで動作し、llama.cpp・MLX・vLLM・SGLang・ONNXに初日対応。
Liquid AIは2026年8月12日、自社ハードウェア上で動かせる「最も高性能な視覚言語モデル」と位置づける「LFM2.5-VL-3B」をHugging Faceで公開した。文書や画面の理解、自然言語クエリによる物体接地(grounding)、ツール呼び出しを得意とし、推論(reasoning)を挟まず直接回答する設計で、リアルタイム・オンデバイス用途での応答速度を優先している。モデルは同日からHugging Faceでダウンロードでき、ブラウザ上で動くWebGPUデモも公開されている。
アーキテクチャと学習方法
LFM2.5-VL-3Bは、SigLIP2 400M NaFlex視覚エンコーダと、テキストモデルLFM2.5-2.6Bと同じ事前学習済みバックボーンを組み合わせた構成だ。事前学習は約34Tトークンで、視覚データは前世代比で4倍に増やし、画像キャプション・OCR・接地・指示追従のキュレーション/合成データセットから学習している。
- 非ラテン文字への対応として、トークナイザの語彙を12.8万に倍増(ゼロから再学習せず既存語彙を拡張)
- 事後学習は2段階構成: 大規模教師モデルからの知識蒸留を伴う教師ありファインチューニング(SFT)と、Antidoomトレーニングを実施
- 続いて複数報酬による強化学習(multi-reward RL)で仕上げ
- 前世代からの主要な改善点は4つ: 画面/UI理解、物体接地、マルチ画像入力、関数呼び出し
公表されたベンチマークと推論速度(Liquid AI公称値)
Liquid AIは視覚・テキスト両方のベンチマークを公開している。いずれも同社が報告する公称値で、評価はvLLM 0.26.0と各モデルの推奨生成パラメータで実施され、非推論モード(直接回答)で統一されている。独立した再現評価は今後を待つ必要がある。
- ScreenSpot-v2(画面理解): デスクトップ78.7/モバイル81.2/Web 82.2(前世代LFM2-VL-3Bは6.0/7.6/2.5)
- RefCOCO平均(物体接地): 87.9(前世代57.1)
- マルチ画像: BLINK 61.5(同50.2)、MuirBench 58.3(同34.9)
- 文書・OCR: DocVQA 91.1、OCRBench v1 84.2、ChartQA 81.3
- ツール使用: ToolSandbox 59.5(同26.4)、BFCL V4 32.5(同20.5)
- 指示追従: IFEval 82.3(同72.9)
推論速度については、オンデバイス推論でM5 Max上228トークン/秒、Ryzen AI Max+ 395上116トークン/秒、メモリ使用量は約3GBと報告する。スマートフォンではGalaxy S26 Ultra上で20トークン/秒に達し、完全オンデバイス動作が可能としている。GPU推論では高並列時に約11Kトークン/秒の出力スループットを記録し、4Bクラスモデルの約2倍で、H100 1枚で1日あたり約10億出力トークンに相当するとの試算を示す。これらの速度数値もLiquid AIによる公称値だ。
提供形態とライセンス
モデルはHugging Faceの LiquidAI/LFM2.5-VL-3B として公開され、transformers>=5.10.1 で AutoModelForImageTextToText から読み込める。推論エコシステムへの初日対応として、llama.cpp、MLX、vLLM、SGLang、ONNXが挙げられている。
- ライセンスは「LFM Open License v1.0」という独自ライセンスで、OSI承認のオープンソースライセンスではない
- 商用利用には「年間収益1,000万ドル以上」の閾値が設定され、閾値を超える法人の商用利用は本ライセンスの対象外(別途ライセンス契約が必要)
- 非営利団体による非商用・研究目的の利用は閾値の対象外
- 同社は「AIがどこでも動く」というビジョンのもと、ファインチューニング用チュートリアルとブラウザデモを併せて公開している
出典: Hugging Face Blog「LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge」、Hugging Faceモデルカード「LiquidAI/LFM2.5-VL-3B」、LFM Open License v1.0(LICENSEファイル)(いずれも2026-08-14確認)。