COMPUTE / 06
vLLM v0.29.0公開 — Model Runner V2が全モデルの既定に、新モデル対応とRL重み同期を強化
vLLM v0.29.0が公開。Model Runner V2の全モデル既定化、新モデル対応、投機的デコーディングとRL重み同期の強化、破壊的変更などを整理。
TAG / TOPIC
「Inference」に関するAIニュースと解説記事の一覧です。
03 STORIES
LATEST STORIES
COMPUTE / 06
vLLM v0.29.0が公開。Model Runner V2の全モデル既定化、新モデル対応、投機的デコーディングとRL重み同期の強化、破壊的変更などを整理。
COMPUTE / 06
vLLM v0.28.0が公開。Kimi-K3の大幅最適化、DeepSeek V4のsparse MLA、投機的デコーディング、Model Runner V2、階層KVキャッシュなどを強化。
COMPUTE / 06
OpenAIが推論チップJalapeñoの初期ベンチマークをHot Chipsで公開。SemiAnalysis InferenceXで現行最上位比の電力効率と低レイテンシを主張。