COMPUTE / 06
vLLM v0.31.0が公開 — 717コミット、DeepSeek-V4.1-Flash高速化と再起動高速化・スケジューラ改善が柱
vLLM v0.31.0(2026年10月5日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。DeepSeek-V4.1-Flash性能改善、Fast restart、Model Runner V2と投機的デコーディング、大規模サービング、破壊的変更を解説。
COMPANIES / TRACKED TOPIC
DeepSeekのモデル、エージェント基盤、公開戦略に関する記事。
19 STORIES
COMPANIES
COMPUTE / 06
vLLM v0.31.0(2026年10月5日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。DeepSeek-V4.1-Flash性能改善、Fast restart、Model Runner V2と投機的デコーディング、大規模サービング、破壊的変更を解説。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年10月2日に安定版v0.5.21を公開。PDインスタンスのprefill/decode動的切替、Rust製radix treeの既定化、Decisions API(/v1/decisions)の新設、DeepSeek-V4.1 Flash・MiMo-V2.6・DiffusionGemmaなど新規7モデル対応、セキュリティ修正を含む。破壊的変更もあるためUpgrade Notesの確認が必要。
COMPUTE / 06
DeepSeekがGitHubのdeepseek-ai organizationでHuawei Ascend NPU向けのDeepGEMM-AscendとDeepEP-Ascendを9月29〜30日に公開。API互換性、対応精度、ライセンス表示の違いを一次情報に基づき整理する。
COMPUTE / 06
vLLM v0.30.0(2026年9月22日公開、安定版)の内容をGitHubリリースノートの一次情報から整理する。新モデル対応、Fast Start、透かし生成、HiSparse、Model Runner V2、破壊的変更を解説。
MODELS / 01
DeepSeekが2026年9月10日にV4.1-Flashを公開。552BパラメータのMoEとCausal Encoder-Decoder、KVキャッシュ削減、APIモデルID・V4-Pro移行スケジュール・オープンスウェイト公開を公式APIドキュメントから整理。
GOVERNANCE / 07
Anthropicが2026年9月に脅威レポートを公開。2025年12月〜2026年8月の悪用阻止事例をサイバー・影響工作・監視・詐欺・生物・通常兵器・不正蒸留の7分野で報告。不正蒸留ではAlibaba(1.51億超)、Moonshot(2300万超)、DeepSeek(14日で1210万超)、Zhipuの活動を帰属つきで記載。
COMPUTE / 06
vLLM v0.29.0が公開。Model Runner V2の全モデル既定化、新モデル対応、投機的デコーディングとRL重み同期の強化、破壊的変更などを整理。
COMPUTE / 06
CloudflareはAI SearchでWorkers AIの6つのテキスト生成モデルを新たにサポート。DeepSeek V4 Flash/Pro、gpt-oss 120B/20B、Qwen3.8-27B、Kimi K2.7 CodeがWorkers AI上でAPIキー不要で利用可能。
COMPUTE / 06
vLLM v0.28.0が公開。Kimi-K3の大幅最適化、DeepSeek V4のsparse MLA、投機的デコーディング、Model Runner V2、階層KVキャッシュなどを強化。
COMPUTE / 06
人気のローカルLLM推論エンジンllama.cppが2026年8月25日にv0.3.0を公開。新アーキテクチャdots3-note(DSA-ISWA KVキャッシュ)と視覚・音声対応、GLM-4.5-AirのMTP、DeepSeek 4のtensor-split(-sm tensor)とマルチシーケンスロールバック修正を含む。ggmlはv0.22.0へ更新しメタバックエンドでのテンソル分割やMetalのper-op並列コンパイルを導入、mtmdはWebPやPillow準拠リサイズ、サーバーとWeb UIも改善された安定版リリース。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。
MODELS / 01
DeepSeekが2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開。V4-Flashと同等のテキスト性能を維持しつつマルチモーダルエージェント性能を大幅強化し、Opus-4.8に迫るとするベンダー公称ベンチマークを提示。料金はV4-Flashと同額、Files APIを同時リリース。
RESEARCH / 04
IBM Researchは2026年8月18日、Hugging Faceブログでエージェントメモリの「適正用量」を検証する研究を公開した。過去の実行軌跡から行動ガイドラインを蒸留し推論時に注入する「ALTK-Evolve」を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルを対象にAppWorld(585タスク)で評価。強力なモデルは全ガイドラインを注入するのが最適(DeepSeek-V3.2はタスク達成率+9.5pp)、弱いモデルはコンパクトなコア+タスク別検索が最適(gpt-oss-120bは+16.1ppを+5%トークンで達成)、飽和モデルは改善なし(GLM-5)という3パターンを報告。費用面では、選択型検索が精度とコストの両面で最良になり得ることを示した。内容はIBM Researchの一次情報(Hugging Faceブログ)に基づく。
BUSINESS / 05
Vercelが2026年8月11日に公開した「AI Gateway Production Index」8月版(7月分データ)を一次情報に基づき整理する。毎月数十兆トークンを中継するAI Gatewayの匿名集計データで、トークン量+59%・支出+37%・平均トークン単価-13.6%、DeepSeekのトークン量2位浮上(約25%対Google 11%)、Anthropicが支出65.1%をトークン量30%で獲得(平均単価は他ラボの4.4倍)、Claude Fable 5の7月復帰後の支出13.2%シェア、オープンウェイトの支出シェア倍増(8.6%)などの数値を、測定方法(支出は各社公表リスト価格で評価)とあわせて解説する。
PRODUCTS / 03
DeepSeek Harness(dsh)のプラグインエコシステム急成長を、一次情報(GitHubリポジトリ・GitHub検索API・リリースページ・公式README)に基づいて整理する。2026年8月18日時点でスター15.6万超、dsh-pluginトピック一致リポジトリ7,135件を確認した。
BUSINESS / 05
DeepSeekが2026年8月16日16:00(UTC)に施行したV4系APIのピーク/オフピーク料金改定を、公式チェンジログと公式料金表に基づいて整理する。ピーク時間帯は01:00〜04:00・06:00〜10:00 UTCで、オフピークはピークの半額。改定前の公式料金表(Wayback Machine保存版)と比較すると、ピーク時で入力(キャッシュヒット)がV4-Flash約5倍・V4-Pro約12倍、出力は両モデルとも約4.6〜4.7倍になる。コンテキストキャッシュの利用価値の変化や、時間帯によるコスト最適化の視点もあわせて解説する。
COMPUTE / 06
Cloudflareは2026年8月14日、Workers AIにDeepSeek V4 FlashとDeepSeek V4 Proを追加した。プラットフォーム初の100万トークンコンテキスト対応モデルで、思考モードと関数呼び出しにも対応する。モデルの特徴、利用方法、提供条件を一次情報(Cloudflare公式Changelog)に基づいて整理する。
AGENTS / 02
DeepSeekが2026年8月13日、オープンソースのエージェント実行基盤「DeepSeek Harness(dsh)」v0.1をMITライセンスで公開した。Cordisカーネル上で「すべてがプラグイン」という設計を採用し、追記専用のセッションログによるトレーサビリティを備える。一次情報(GitHubリポジトリ・公式ページ)に基づき整理する。
MODELS / 01
DeepSeekが2026年8月13日、フラッグシップモデルDeepSeek-V4-Proの正式版(GA)を公開した。エージェント能力の強化、Responses API対応、思考量制御、新料金体系を一次情報に基づいて整理する。