液冷式AIサーバーと発光する計算基盤の抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / INFRASTRUCTURE

vLLM v0.30.0が公開 — 762コミット、DeepSeek-V4.1-Flash対応とFast Start・透かし生成が柱

大規模言語モデル推論サーバーのvLLMが2026年9月22日にv0.30.0の安定版を公開した。315人のコントリビューターによる762コミットを含み、DeepSeek-V4.1-FlashやGLM-5.3-Flashなど新モデルのサポート、再起動を高速化するFast Start、Gumbel-max方式の透かし生成などが柱。スケールアウト系エンドポイントの既定変更など破壊的変更もある。

大規模言語モデル向けの高性能推論サーバー「vLLM」が、2026年9月22日(UTC)に安定版「v0.30.0」を公開した。リリースノートによれば、315人のコントリビューター(うち104人が新規)による762コミットを含む大型のマイナーリリースで、新モデルのサポート拡充、起動高速化、透かし生成、疎な注意機構向けのメモリ階層化などが柱となっている。本稿はGitHubのリリースノートで確認できる範囲に限定して整理する。

新モデルサポートの拡充

  • DeepSeek-V4.1-Flash: KV全体をMXFP8で保持するFlashMLA V4.1経路(SM100向け)などに対応
  • DeepSeek-V4-Flash-Vision-Exp: ビジョンモデルの実験的チェックポイントに対応。ROCmとLoRAにも対応
  • GLM-5.3-Flash: EPLB対応を含む
  • その他: K2-Horizon(推論・ツールパーサー付き)、Cohere Compass、Bailing V3 VL、Nanbeige4.2(Transformersバックエンド経由)、DeepSeek-V4のCPUバックエンド
  • 性能向上の個別施策として、Qwen3.8-Flash-Next向けのプリフィル/デコード分離カーネルや、Kimi K3向けのCUDA最適化なども多く含まれる
  • 各モデル固有の性能数値はリリースノートの個別PR記載に依存するため、本記事では断定しない

Fast Start・透かし生成・HiSparse

  • Fast Start: GPUメモリに量子化・シャーディング済みの重みを保持する常駐デーモンを用意し、エンジン再起動時にディスクからの再読み込みではなくCUDA IPC経由でマッピングする--load-format ipc_cacheを追加。FP4チェックポイントやマルチノードTPにも対応
  • 透かし生成(Watermarking): キー付きPRFによるGumbel-max方式の透かし付き生成と検出をサポート。リクエスト単位のオプトアウトや検出用エンドポイント例も用意され、投機的デコーディングと両立するデュアルキー方式も含む
  • HiSparse: 疎なMLAデコード向けに、KVページをホストのピン留めメモリに退避させるホスト常駐層。HiSparseConnector経由で有効化する
  • Model Runner V2: デュアルバッチのオーバーラップ、パイプライン並列下での投機的デコーディング、グラフ取得時間の短縮(リリースノートの記載ではH200でエンジン初期化が28.9秒から8.2秒に)といった改善

破壊的変更と提供形態

  • 破壊的変更: 素のvllm serveではスケールアウト系エンドポイントが既定で無効になり、--enable-scale-outでのオプトインが必要に。GPTQの活性化順序(g_idx)の削除、v0.29で非推奨だった項目の削除、python -m vllm.entrypoints.grpc_serverの非推奨化(vllm serve --grpcへ移行)などがある。更新時はリリースノートの該当節の確認が必要
  • 提供形態: PyPIのCUDA 13.0ホイール、ROCm/XPU/CPU向けホイール、CUDA/ROCm/CPU/XPU向けDockerイメージが用意されている
  • 量子化(対象指定のオンライン量子化、W4A16、NVFP4、AutoRoundなど)、OpenAI/Anthropic/Cohere互換API、構造化出力、Rustフロントエンドなど広範な更新を含む。詳細はリリースノート全文を参照されたい

出典