COMPUTE / 06
vLLM v0.31.0が公開 — 717コミット、DeepSeek-V4.1-Flash高速化と再起動高速化・スケジューラ改善が柱
vLLM v0.31.0(2026年10月5日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。DeepSeek-V4.1-Flash性能改善、Fast restart、Model Runner V2と投機的デコーディング、大規模サービング、破壊的変更を解説。
MODELS / TRACKED TOPIC
DeepSeek V4ファミリーとエージェント能力に関する記事。
09 STORIES
MODELS
COMPUTE / 06
vLLM v0.31.0(2026年10月5日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。DeepSeek-V4.1-Flash性能改善、Fast restart、Model Runner V2と投機的デコーディング、大規模サービング、破壊的変更を解説。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年10月2日に安定版v0.5.21を公開。PDインスタンスのprefill/decode動的切替、Rust製radix treeの既定化、Decisions API(/v1/decisions)の新設、DeepSeek-V4.1 Flash・MiMo-V2.6・DiffusionGemmaなど新規7モデル対応、セキュリティ修正を含む。破壊的変更もあるためUpgrade Notesの確認が必要。
COMPUTE / 06
vLLM v0.30.0(2026年9月22日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。新モデル対応、Fast Start、透かし生成、HiSparse、Model Runner V2、破壊的変更を解説。
MODELS / 01
DeepSeekが2026年9月10日にV4.1-Flashを公開。552BパラメータのMoEとCausal Encoder-Decoder、KVキャッシュ削減、APIモデルID・V4-Pro移行スケジュール・オープンスウェイト公開を公式APIドキュメントから整理。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。
MODELS / 01
DeepSeekが2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開。V4-Flashと同等のテキスト性能を維持しつつマルチモーダルエージェント性能を大幅強化し、Opus-4.8に迫るとするベンダー公称ベンチマークを提示。料金はV4-Flashと同額、Files APIを同時リリース。
BUSINESS / 05
DeepSeekが2026年8月16日16:00(UTC)に施行したV4系APIのピーク/オフピーク料金改定を、公式チェンジログと公式料金表に基づいて整理する。ピーク時間帯は01:00〜04:00・06:00〜10:00 UTCで、オフピークはピークの半額。改定前の公式料金表(Wayback Machine保存版)と比較すると、ピーク時で入力(キャッシュヒット)がV4-Flash約5倍・V4-Pro約12倍、出力は両モデルとも約4.6〜4.7倍になる。コンテキストキャッシュの利用価値の変化や、時間帯によるコスト最適化の視点もあわせて解説する。
COMPUTE / 06
Cloudflareは2026年8月14日、Workers AIにDeepSeek V4 FlashとDeepSeek V4 Proを追加した。プラットフォーム初の100万トークンコンテキスト対応モデルで、思考モードと関数呼び出しにも対応する。モデルの特徴、利用方法、提供条件を一次情報(Cloudflare公式Changelog)に基づいて整理する。
MODELS / 01
DeepSeekが2026年8月13日、フラッグシップモデルDeepSeek-V4-Proの正式版(GA)を公開した。エージェント能力の強化、Responses API対応、思考量制御、新料金体系を一次情報に基づいて整理する。