青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / MODEL WATCH

Liquid AI、エッジ向け最上位VLM「LFM2.5-VL-3B」を公開 — 画面理解・物体接地・ツール呼び出しを強化

SigLIP2 400M視覚エンコーダとLFM2.5-2.6Bテキストバックボーンを組み合わせ、約34Tトークンで事前学習。ScreenSpot-v2でデスクトップ78.7・モバイル81.2・Web 82.2、RefCOCO平均87.9を記録(Liquid AI公称値)。M5 Maxで228トークン/秒、約3GBのメモリで動作し、llama.cpp・MLX・vLLM・SGLang・ONNXに初日対応。

Liquid AIは2026年8月12日、自社ハードウェア上で動かせる「最も高性能な視覚言語モデル」と位置づける「LFM2.5-VL-3B」をHugging Faceで公開した。文書や画面の理解、自然言語クエリによる物体接地(grounding)、ツール呼び出しを得意とし、推論(reasoning)を挟まず直接回答する設計で、リアルタイム・オンデバイス用途での応答速度を優先している。モデルは同日からHugging Faceでダウンロードでき、ブラウザ上で動くWebGPUデモも公開されている。

アーキテクチャと学習方法

LFM2.5-VL-3Bは、SigLIP2 400M NaFlex視覚エンコーダと、テキストモデルLFM2.5-2.6Bと同じ事前学習済みバックボーンを組み合わせた構成だ。事前学習は約34Tトークンで、視覚データは前世代比で4倍に増やし、画像キャプション・OCR・接地・指示追従のキュレーション/合成データセットから学習している。

  • 非ラテン文字への対応として、トークナイザの語彙を12.8万に倍増(ゼロから再学習せず既存語彙を拡張)
  • 事後学習は2段階構成: 大規模教師モデルからの知識蒸留を伴う教師ありファインチューニング(SFT)と、Antidoomトレーニングを実施
  • 続いて複数報酬による強化学習(multi-reward RL)で仕上げ
  • 前世代からの主要な改善点は4つ: 画面/UI理解、物体接地、マルチ画像入力、関数呼び出し

公表されたベンチマークと推論速度(Liquid AI公称値)

Liquid AIは視覚・テキスト両方のベンチマークを公開している。いずれも同社が報告する公称値で、評価はvLLM 0.26.0と各モデルの推奨生成パラメータで実施され、非推論モード(直接回答)で統一されている。独立した再現評価は今後を待つ必要がある。

  • ScreenSpot-v2(画面理解): デスクトップ78.7/モバイル81.2/Web 82.2(前世代LFM2-VL-3Bは6.0/7.6/2.5)
  • RefCOCO平均(物体接地): 87.9(前世代57.1)
  • マルチ画像: BLINK 61.5(同50.2)、MuirBench 58.3(同34.9)
  • 文書・OCR: DocVQA 91.1、OCRBench v1 84.2、ChartQA 81.3
  • ツール使用: ToolSandbox 59.5(同26.4)、BFCL V4 32.5(同20.5)
  • 指示追従: IFEval 82.3(同72.9)

推論速度については、オンデバイス推論でM5 Max上228トークン/秒、Ryzen AI Max+ 395上116トークン/秒、メモリ使用量は約3GBと報告する。スマートフォンではGalaxy S26 Ultra上で20トークン/秒に達し、完全オンデバイス動作が可能としている。GPU推論では高並列時に約11Kトークン/秒の出力スループットを記録し、4Bクラスモデルの約2倍で、H100 1枚で1日あたり約10億出力トークンに相当するとの試算を示す。これらの速度数値もLiquid AIによる公称値だ。

提供形態とライセンス

モデルはHugging Faceの LiquidAI/LFM2.5-VL-3B として公開され、transformers>=5.10.1 で AutoModelForImageTextToText から読み込める。推論エコシステムへの初日対応として、llama.cpp、MLX、vLLM、SGLang、ONNXが挙げられている。

  • ライセンスは「LFM Open License v1.0」という独自ライセンスで、OSI承認のオープンソースライセンスではない
  • 商用利用には「年間収益1,000万ドル以上」の閾値が設定され、閾値を超える法人の商用利用は本ライセンスの対象外(別途ライセンス契約が必要)
  • 非営利団体による非商用・研究目的の利用は閾値の対象外
  • 同社は「AIがどこでも動く」というビジョンのもと、ファインチューニング用チュートリアルとブラウザデモを併せて公開している

出典: Hugging Face Blog「LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge」、Hugging Faceモデルカード「LiquidAI/LFM2.5-VL-3B」、LFM Open License v1.0(LICENSEファイル)(いずれも2026-08-14確認)。