TAG / TOPIC

llama.cpp

「llama.cpp」に関するAIニュースと解説記事の一覧です。

06 STORIES

LATEST STORIES

llama.cppの新着記事

タグ一覧

MODELS / 01

Liquid AI、エッジ向けオープンウェイト決定モデル「d1-3B」「d1-omni-600M」を公開 — トークン生成なしの単一フォワードパスで回答

Liquid AIが2026年10月7日に公開したオープンウェイト決定モデルd1-3Bとd1-omni-600Mを公式ブログ・Hugging Faceの一次情報から整理。単一フォワードパス回答の設計、Decision Indexや7種テキストベンチマークの公称値、NVIDIA・AMD・Apple・Jetsonでのレイテンシ、llama.cpp対応とライセンス上の注意を扱う。

COMPUTE / 06

llama.cpp v0.4.0公開 — Qwen3.8-Flash-Nextの初期対応と遅延テンソル読み込み、ggml 0.23.0へ更新

ローカルLLM推論エンジンllama.cppが2026年9月4日に安定版v0.4.0を公開。Qwen3.8-Flash-Next(qwen4exp)の初期アーキテクチャ対応、NVIDIA Nemotron-3-Puzzle-75B-A9BとNemotron 3.5のDSpark対応、遅延テンソル読み込み、スロット別コンテキスト上限、動画入力オプション、ggml v0.23.0(スパースflash attention・Apple RDMA)への更新を含む。

COMPUTE / 06

llama.cpp v0.3.0公開 — Dots3-Note対応とDeepSeek 4テンソル分割、ggml 0.22.0へ更新

人気のローカルLLM推論エンジンllama.cppが2026年8月25日にv0.3.0を公開。新アーキテクチャdots3-note(DSA-ISWA KVキャッシュ)と視覚・音声対応、GLM-4.5-AirのMTP、DeepSeek 4のtensor-split(-sm tensor)とマルチシーケンスロールバック修正を含む。ggmlはv0.22.0へ更新しメタバックエンドでのテンソル分割やMetalのper-op並列コンパイルを導入、mtmdはWebPやPillow準拠リサイズ、サーバーとWeb UIも改善された安定版リリース。

MODELS / 01

Liquid AI、LFM2.5向けDSparkドラフトを公開 — 推論を最大3.2倍高速化、品質はそのままにllama.cpp / SGLang対応

Liquid AIは2026年8月20日、Hugging FaceブログでLFM2.5向け投機的デコーディング「LFM2.5-DSpark」を公開した。LFM2.5-1.2B-Instruct/2.6B/8B-A1B向けに各約300Mパラメータ(5層・ブロック9)のアテンション特化ドラフトを提供。DFlash並列バックボーン+マルコフ逐次ヘッド+信頼度スケジュール検証のDSpark構成を採用。llama.cpp(M4 Max MacBook Pro・Metal・FP16 GGUF)とSGLang(H100・BF16)で評価し、H100で最大3.18倍、M4 Maxで最大2.87倍のスループット向上を報告。greedyではターゲットと同一出力のため精度不変、2.6BではBFCL相当の多ツール呼び出しレイテンシを平均57%削減。llama.cppとSGLangにday-one対応。