NAW / COMPUTE 06
IMAGE: AI生成ビジュアル
COMPUTE / Infrastructure
llama.cpp v0.6.0公開 — 新バッチAPI・GLM-5.3-Flash 320B対応・decisionモデル用サーバーAPIを追加
ローカルLLM推論エンジンllama.cppが2026年10月5日(UTC)に安定版v0.6.0を公開した。混合トークン・埋め込み入力を扱うllama_batch_ext拡張バッチAPI、GLM-5.3-Flash(GLM5-Next)320BとClef decisionモデルのサポート、decisionモデル用 /v1/systemone サーバーAPI、Hugging Face Hub連携のWeb UI刷新、ggml v0.26.0への更新が柱。セッション・状態のバージョンが上がる破壊的変更を含む。
ローカルLLM推論の定番エンジン llama.cpp が2026年10月5日(UTC)、安定版 v0.6.0 を公開した。前回 v0.5.0 からの差分として整理されたメジャーバージョンアップで、拡張バッチAPI、GLM-5.3-Flash 320BとClef decisionモデルの新規サポート、decisionモデル用の新サーバーAPI、Web UIの刷新、そして ggml v0.26.0 への更新を柱とする。いずれも一次情報であるGitHubリリースノートの記載範囲で整理する。
コアAPI — llama_batch_ext拡張バッチAPIと互換性注意
- 新API:
llama_batch_ext拡張バッチAPIをllama_process()、llama_process_typeとともに導入。トークンと埋め込みの混合バッチ、MTP・deepstackモデル向けのトークン単位のstate埋め込みを扱える - 移行: examples、投機的デコーディング、mtmd、serverが新APIへ移行済みで、バッチは埋め込みと生トークンの両方を受け付ける
- 破壊的変更の可能性:
LLAMA_SESSION_VERSIONが11、LLAMA_STATE_SEQ_VERSIONが4へ上がっている。旧バージョンで保存したセッション・KV状態との互換性に注意が必要だ - 量子化・精度: モデル駆動のW4A4(NVFP4/MXFP4)mul_matパスと
llama_prec_policyを追加。reranker向けのclassifier_poolingサポートも含まれる
新モデル対応 — GLM-5.3-Flash 320B、Clef、Qwen4Exp、Ling 3.0 VL
- GLM-5.3-Flash(GLM5-Next): 320BのKDA/DSAハイブリッドのテキスト+visionモデルをサポート。mHCとMoE構成と記載されている
- Clef decisionモデル: テキストとvisionの両方でフルサポート。Nimble decisionモデル、Ling 3.0 VL(BailingMoeV3アーキテクチャに統合)、LFM2.5-Encoder-230M/350Mの登録も追加された
- Qwen4Exp: 高品質サポートとしてMTP投機デコーディングを追加。リリースノートではDGX Spark上でデコード約1.5倍の高速化と記載されている(ベンダー側の測定値であり、独立検証ではない)。各種正確性修正、indexerのスコアメモリ半減、マスク構築の最適化も含まれる
- 注意: ここでの「対応」はllama.cpp側の推論サポートを指し、各モデルの重みの公開条件やライセンスはllama.cppのリリースノートの範囲外だ
サーバー・UI・バックエンド — systemone API、HF Hub連携、Metal高速化
- サーバー: decisionモデル用の新エンドポイント
/v1/systemoneを追加し、laya・julia-1・lev・openjev(+vision)・kev、さらにnimbleを対象とする。/v1/embeddingsは視覚・音声・動画の型付きコンテンツ入力を受け付け、GET /v1/modelsとGET /modelsはモデルの入出力モダリティを新しいarchitectureオブジェクトで報告する - Web UI刷新: モデルダウンロードパイプライン、Hugging Face Hubデータ層、モデルのメモリ適合見積もり(memory-fit estimation)、モデルID文法によるsidecar・量子化・ケーパビリティ解析を追加
- Metal(Apple GPU): F16 KV向けのtensor API flash attentionカーネルを新設。投機・バッチデコード向けのfew-row MMA mat-mulカーネルはApple GPUで最大約3倍の高速化と記載されている(リリースノート記載の公称値)。Vulkanでは量子化K/V向けスパースflash attentionなどを追加
- ggml v0.26.0: バッファ割り当てAPIの追加、SYCL・Vulkan・Metalのスパースflash attention、lightning indexerの改善、CPUバックエンドのBF16演算、CUDAのモデル駆動W4A4パスなどを含む。Windows ARM64のMSVCビルドも有効化された
日常的にnightlyビルドを使っている利用者は、安定版タグへの切り替え前にセッション・状態バージョンの変更と新APIへの移行状況を確認しておくとよい。