液冷式AIサーバーと発光する計算基盤の抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / Infrastructure

SGLang v0.5.21公開 — PDのprefill/decode動的切替とRust製radix tree既定化、Decisions API新設

2026年10月2日(UTC)に安定版v0.5.21を公開。再起動なしでprefillとdecodeを切り替えるPDランタイム切替、Rustコアのprefix cache既定化、LLMを低遅延分類器にするDecisions API、DeepSeek-V4.1 FlashやMiMo-V2.6など新規7モデル対応が柱。chat_templateの外部指定拒否などセキュリティ修正も含む。

高性能な大規模言語モデル/マルチモーダルモデルのサービングフレームワーク SGLang が2026年10月2日(UTC)、安定版 v0.5.21 を公開した(draft・prereleaseではない正式リリース)。前回 v0.5.19(本サイトでも紹介済み)以降の変更を束ねたリリースで、PD分離servingの柔軟化、キャッシュ基盤のRust化の完成、新規推論APIの追加、新規7モデルの対応が柱だ。以下は一次情報であるGitHubリリースノートの記載範囲で整理する。性能の改善率はすべて開発チーム自身の計測による公称値である。

実行基盤 — PD動的切替、Rust製radix treeの既定化、Decisions API

  • PDランタイムの役割切替: prefill/decode分離(PD)構成のインスタンスが、再起動なしにprefillとdecodeの役割をその場で切り替えられるようになった。負荷の偏りに応じて役割を振り直せるため、分離構成の運用自由度が上がる。
  • Rust製radix treeが既定に: prefix cache(統合radix tree)の既定実装がRustコアになった。Rustコアが未対応の設定は自動でPython実装にフォールバックする。明示的にPython実装へ戻す場合は環境変数 SGLANG_UNIFIED_RADIX_TREE_CORE_BACKEND=python を設定する。
  • Decisions APIの新設: 新エンドポイント /v1/decisions により、LLM/VLMを低遅延の分類器・スコアラーとして使えるようになった。ルーティング判定や品質スコア付けなど、生成ではなく判定が目的の用途を想定した追加だ。
  • 並列構成の精度改善: パイプライン並列(PP)、DP attention、コンテキスト並列(CP)下での結果精度を改善し、層間通信をSGLang側で扱う方式に整理した。
  • 投機的デコーディング: パイプライン並列と投機的デコーディング(EAGLE/MTP)の併用に対応した。

新規モデルと性能 — DeepSeek-V4.1 Flash、MiMo-V2.6、DiffusionGemmaなど7種

  • 新規対応モデル: DeepSeek-V4.1 Flash、GigaChat 3.5、IQuest-Q1、MiMo-V2.6/MiMo-V2.6-Pro(Xiaomi系)、Ling-3.0-flash-VL、DiffusionGemma、Qwen-Image 2.1の7種。LLM/VLMに加え、Diffusion系(DiffusionGemma、Qwen-Image 2.1)の対応が含まれる。
  • DeepSeek-V4.1の高速化: 長いプロンプトにおける初回トークン生成が22%高速化したとしている。Kimi K3はPD serving下のprefillスループットが20.6%向上したとしている。いずれも開発チームの計測値であり、環境依存に留意が必要だ。
  • AMD対応の拡大: GLM-5.3-FlashがAMD MI355Xで動作するようになり、FP8/MXFP4 MoEとMTP投機的デコーディングに対応した。クックブックにはB200 FP4向けのDeepSeek-V4系PD分離ガイドなども追加されている。
  • 依存関係: xgrammar 0.2.1→0.2.7、cache-dit 1.3.0→1.5.1、sgl-eval 0.1.0→0.1.2へ更新。sentencepieceは0.2.1に固定(0.2.2はInternVL系トークナイザのnull pieceを拒否するため)。

運用者向け — セキュリティ修正と破壊的変更

  • セキュリティ修正: OpenAI互換APIで、リクエスト側が指定する chat_template を既定で拒否するようになった。SafeUnpicklerの標準ライブラリグローバルの制限も強化された。外部入力を受ける公開エンドポイントを運用している場合は優先度の高い更新だ。
  • FlashInfer MoEの既定変更: 数値精度のため、FlashInfer MoEのfused finalizeが既定で無効になった。W4A4 MoEではわずかに遅延が増える可能性があり、従来の動作に戻す場合は SGLANG_FLASHINFER_MOE_FUSED_FINALIZE=1 を設定する。
  • PD decodeのKV扱い変更: PD decode側のKVキャッシュ扱いに変更が入っている(リリースノートのBreaking Changes & Upgrade Notesに記載)。更新時は同節と既知の問題を確認し、特に自前で ServerArgs を構築している実装では設定の見直しが必要だ。

出典