半導体チップとデータセンターをつなぐ青い抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / Infrastructure

SGLang v0.5.18公開 — 710 PRで起動2.38倍高速化、Muse Glimmerなど新規モデル7種に対応

212名のコントリビューターが参加した大規模リリース。チェックポイントのオーバーラップ読み込みでQwen3-32Bの起動を35.6秒に短縮、BlackwellでのFlashInfer最適化で最大6.9%向上、Muse GlimmerやIntern-S2、動画生成モデル群を新たにサポート。

高性能な大規模言語モデル/マルチモーダルモデルのサービングフレームワーク SGLang が2026年8月22日(UTC)、v0.5.18 を公開した。710件のPRを212名のコントリビューターが寄せた大規模な安定版リリースで、新規モデル対応と推論・起動パフォーマンスの最適化、キャッシュと依存関係の整理が柱となっている。

新規対応モデルとレシピ — Muse Glimmerから動画生成まで

本リリースでクックブック(docs.sglang.io/cookbook)に追加された新規対応モデルは以下のとおりだ。

  • Muse Glimmer — Autoregressive (Multimodal) [#34262]
  • Intern-S2-Mobius — Autoregressive [#33691]
  • SANA-Video — Diffusion [#32921]
  • LingBot-Video-MoE — Diffusion [#32341]
  • LTX-2.5 — Diffusion [#34471]
  • Cosmos3 Edge & Distilled — Diffusion [#31590]
  • LongCat-Image — Diffusion [#23274]

さらに、既存ファミリーのレシピも拡充された。Qwen3.8ファミリー、Ling-3.0、NVIDIA Nemotron 3.5 Lightning、RedNote Dots3-Note、DeepSeek-V4-Pro-0813(#34809)向けのクックブックが追加されている。新規モデルの対応は、SGLangがテキスト生成だけでなく動画・画像生成のDiffusion系までカバーする統合サービング基盤としての射程を広げていることを示す。

起動と推論を高速化 — オーバーラップ読み込みとBlackwell最適化

パフォーマンス面では、起動時とデコード時の両面で最適化が入った。いずれも一次情報のリリースノートに記載されたベンダー計測値であり、環境依存の参考値として扱いたい。

  • オーバーラップ・チェックポイント・ステージング: 起動時にストレージからのチェックポイント読み込みとCUDAグラフのキャプチャを並列化。Qwen3-32B on H100で、プリフェッチ付き逐次実行比で8.6〜11.7%高速、デフォルト逐次比では84.8秒→35.6秒で2.38倍としている。--startup-weight-load-mode overlap で有効化する [#32017]。
  • TP LMHeadのAll-to-All化: 純粋なDP(dp-attention)構成で、TP LMHeadのallgather+scatterを単一のall-to-allに置換。DeepSeek-V4-Pro on B200のデコードでLMHead時間が320μs→169μs、TPOT(Time Per Output Token)が36.97ms→35.67msへ改善したとしている [#32313]。
  • FlashInfer MNNVLによるpure allreduce: 非融合のallreduceをFlashInfer MNNVLワークスペースに統合し、NCCLへのフォールバックを回避。DeepSeek-V4-Flash TP4 on Blackwellのデコードで**小バッチ時に最大+6.9%**のゲイン。DeepSeek-V3/V3.2/V4では自動有効、その他は --enable-flashinfer-pure-allreduce で有効化 [#30700]。

運用と互換性 — 統合キャッシュと依存関係の更新

運用面では、コンパイル済みカーネルのキャッシュ管理が刷新された。

  • 統合キャッシュディレクトリ: Triton、FlashInfer、Inductor、DeepGEMM、CUDAドライバのキャッシュをすべて SGLANG_CACHE_DIR 配下に集約。アップグレード後の初回起動で一度だけ再コンパイルが発生する [#32434]。 breaking changeとして明記されており、CI/CDやコンテナのキャッシュパスを見直す必要がある。
  • 依存関係の更新: torch 2.13.0 + triton 3.7.1 [#28836]、flashinfer 0.6.17 [#33997]、CuTeDSL 4.6.2(BlackwellでのFA4起動回帰を修正 [#34372])、DeepEPはリリース済み sgl-deep-ep ホイールからのインストールに移行 [#33932]、sgl-kernel 0.4.6.post1 [#33842]。
  • その他の基盤改善: RustサーバーでのQwen VL向けネイティブ・マルチモーダル処理統合 [#32365]、投機的デコーディング(Speculative Decoding)周りの多数の修正(DSpark/DFlash関連、KV破損の修正など)も含まれる。いずれも大規模デプロイでの安定性に関わる変更だ。

v0.5.18は破壊的変更(Breaking Changes)と既知の問題(Known Issues)を末尾にまとめている。統合キャッシュへの移行に伴う初回再コンパイルや、一部フラグのデフォルト変更に注意が必要だ。アップグレード前にリリースノートの該当節を確認し、ステージング環境で起動時間とスループットの回帰を計測することを推奨する。

出典