TAG / TOPIC

推論基盤

「推論基盤」に関するAIニュースと解説記事の一覧です。

08 STORIES

LATEST STORIES

推論基盤の新着記事

タグ一覧

COMPUTE / 06

SGLang v0.5.21公開 — PDのprefill/decode動的切替とRust製radix tree既定化、Decisions API新設

高性能LLMサービングフレームワークSGLangが2026年10月2日に安定版v0.5.21を公開。PDインスタンスのprefill/decode動的切替、Rust製radix treeの既定化、Decisions API(/v1/decisions)の新設、DeepSeek-V4.1 Flash・MiMo-V2.6・DiffusionGemmaなど新規7モデル対応、セキュリティ修正を含む。破壊的変更もあるためUpgrade Notesの確認が必要。

COMPUTE / 06

SGLang v0.5.19公開 — ビームサーチ対応とDeepEP v2、統合radix treeの既定化で786 PR

高性能LLMサービングフレームワークSGLangが2026年9月5日に安定版v0.5.19を公開。786件のPR・214名のコントリビューターによる大規模リリースで、ビームサーチ対応、DeepEP v2 ElasticBufferバックエンド、統合radix treeの既定化、LayerNorm系列並列、Hopper向けW4A8 MoE、Blackwell既定バックエンドでのDCP、AMD向けLean attention、Qwen3.8・Spark2.5・Granite 4.2など9モデルの新規対応を含む。

COMPUTE / 06

llama.cpp v0.4.0公開 — Qwen3.8-Flash-Nextの初期対応と遅延テンソル読み込み、ggml 0.23.0へ更新

ローカルLLM推論エンジンllama.cppが2026年9月4日に安定版v0.4.0を公開。Qwen3.8-Flash-Next(qwen4exp)の初期アーキテクチャ対応、NVIDIA Nemotron-3-Puzzle-75B-A9BとNemotron 3.5のDSpark対応、遅延テンソル読み込み、スロット別コンテキスト上限、動画入力オプション、ggml v0.23.0(スパースflash attention・Apple RDMA)への更新を含む。

COMPUTE / 06

NVIDIA、無料のローカル推論ルーター「PAIR」ベータを公開 — 自宅のRTX・DGX Spark・Macを束ねて単一エンドポイント化

NVIDIAが2026年9月3日にPersonal AI Router(PAIR)ベータを公開。自宅のRTX PC・DGX Spark・MacをプライベートなローカルAIクラスタとして束ね、OllamaやLM Studioの推論要求を単一エンドポイントで振り分ける無料ツール。要件・仕組み・提供形態を一次情報に基づいて整理する。

COMPUTE / 06

llama.cpp v0.3.0公開 — Dots3-Note対応とDeepSeek 4テンソル分割、ggml 0.22.0へ更新

人気のローカルLLM推論エンジンllama.cppが2026年8月25日にv0.3.0を公開。新アーキテクチャdots3-note(DSA-ISWA KVキャッシュ)と視覚・音声対応、GLM-4.5-AirのMTP、DeepSeek 4のtensor-split(-sm tensor)とマルチシーケンスロールバック修正を含む。ggmlはv0.22.0へ更新しメタバックエンドでのテンソル分割やMetalのper-op並列コンパイルを導入、mtmdはWebPやPillow準拠リサイズ、サーバーとWeb UIも改善された安定版リリース。

COMPUTE / 06

SGLang v0.5.18公開 — 710 PRで起動2.38倍高速化、Muse Glimmerなど新規モデル7種に対応

高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。