IMAGE: AI生成ビジュアル
COMPUTE / Infrastructure
SGLang v0.5.18公開 — 710 PRで起動2.38倍高速化、Muse Glimmerなど新規モデル7種に対応
212名のコントリビューターが参加した大規模リリース。チェックポイントのオーバーラップ読み込みでQwen3-32Bの起動を35.6秒に短縮、BlackwellでのFlashInfer最適化で最大6.9%向上、Muse GlimmerやIntern-S2、動画生成モデル群を新たにサポート。
高性能な大規模言語モデル/マルチモーダルモデルのサービングフレームワーク SGLang が2026年8月22日(UTC)、v0.5.18 を公開した。710件のPRを212名のコントリビューターが寄せた大規模な安定版リリースで、新規モデル対応と推論・起動パフォーマンスの最適化、キャッシュと依存関係の整理が柱となっている。
新規対応モデルとレシピ — Muse Glimmerから動画生成まで
本リリースでクックブック(docs.sglang.io/cookbook)に追加された新規対応モデルは以下のとおりだ。
- Muse Glimmer — Autoregressive (Multimodal) [#34262]
- Intern-S2-Mobius — Autoregressive [#33691]
- SANA-Video — Diffusion [#32921]
- LingBot-Video-MoE — Diffusion [#32341]
- LTX-2.5 — Diffusion [#34471]
- Cosmos3 Edge & Distilled — Diffusion [#31590]
- LongCat-Image — Diffusion [#23274]
さらに、既存ファミリーのレシピも拡充された。Qwen3.8ファミリー、Ling-3.0、NVIDIA Nemotron 3.5 Lightning、RedNote Dots3-Note、DeepSeek-V4-Pro-0813(#34809)向けのクックブックが追加されている。新規モデルの対応は、SGLangがテキスト生成だけでなく動画・画像生成のDiffusion系までカバーする統合サービング基盤としての射程を広げていることを示す。
起動と推論を高速化 — オーバーラップ読み込みとBlackwell最適化
パフォーマンス面では、起動時とデコード時の両面で最適化が入った。いずれも一次情報のリリースノートに記載されたベンダー計測値であり、環境依存の参考値として扱いたい。
- オーバーラップ・チェックポイント・ステージング: 起動時にストレージからのチェックポイント読み込みとCUDAグラフのキャプチャを並列化。Qwen3-32B on H100で、プリフェッチ付き逐次実行比で8.6〜11.7%高速、デフォルト逐次比では84.8秒→35.6秒で2.38倍としている。
--startup-weight-load-mode overlapで有効化する [#32017]。 - TP LMHeadのAll-to-All化: 純粋なDP(dp-attention)構成で、TP LMHeadのallgather+scatterを単一のall-to-allに置換。DeepSeek-V4-Pro on B200のデコードでLMHead時間が320μs→169μs、TPOT(Time Per Output Token)が36.97ms→35.67msへ改善したとしている [#32313]。
- FlashInfer MNNVLによるpure allreduce: 非融合のallreduceをFlashInfer MNNVLワークスペースに統合し、NCCLへのフォールバックを回避。DeepSeek-V4-Flash TP4 on Blackwellのデコードで**小バッチ時に最大+6.9%**のゲイン。DeepSeek-V3/V3.2/V4では自動有効、その他は
--enable-flashinfer-pure-allreduceで有効化 [#30700]。
運用と互換性 — 統合キャッシュと依存関係の更新
運用面では、コンパイル済みカーネルのキャッシュ管理が刷新された。
- 統合キャッシュディレクトリ: Triton、FlashInfer、Inductor、DeepGEMM、CUDAドライバのキャッシュをすべて
SGLANG_CACHE_DIR配下に集約。アップグレード後の初回起動で一度だけ再コンパイルが発生する [#32434]。 breaking changeとして明記されており、CI/CDやコンテナのキャッシュパスを見直す必要がある。 - 依存関係の更新: torch 2.13.0 + triton 3.7.1 [#28836]、flashinfer 0.6.17 [#33997]、CuTeDSL 4.6.2(BlackwellでのFA4起動回帰を修正 [#34372])、DeepEPはリリース済み
sgl-deep-epホイールからのインストールに移行 [#33932]、sgl-kernel 0.4.6.post1 [#33842]。 - その他の基盤改善: RustサーバーでのQwen VL向けネイティブ・マルチモーダル処理統合 [#32365]、投機的デコーディング(Speculative Decoding)周りの多数の修正(DSpark/DFlash関連、KV破損の修正など)も含まれる。いずれも大規模デプロイでの安定性に関わる変更だ。
v0.5.18は破壊的変更(Breaking Changes)と既知の問題(Known Issues)を末尾にまとめている。統合キャッシュへの移行に伴う初回再コンパイルや、一部フラグのデフォルト変更に注意が必要だ。アップグレード前にリリースノートの該当節を確認し、ステージング環境で起動時間とスループットの回帰を計測することを推奨する。