PRODUCTS / 03
Transformersがllama.cpp量子化(GGUF)を直接実行可能に — Apple Siliconでllama.cppに迫る速度
Hugging Faceが2026年9月22日に公開したTransformersのGGUF対応を整理。ggmlカーネルの再利用、Qwen3.5系からの対応、from_pretrainedとtransformers serveでの使い方、llama.cppとの速度比較、MPS限定などの制約を扱う。
TAG / TOPIC
「GGUF」に関するAIニュースと解説記事の一覧です。
02 STORIES
LATEST STORIES
PRODUCTS / 03
Hugging Faceが2026年9月22日に公開したTransformersのGGUF対応を整理。ggmlカーネルの再利用、Qwen3.5系からの対応、from_pretrainedとtransformers serveでの使い方、llama.cppとの速度比較、MPS限定などの制約を扱う。
MODELS / 01
Liquid AIは2026年8月19日、Hugging FaceブログでLFM2.5向けのQ4_0 GGUFをQuantization-Aware Distillation(QAD)で刷新したと発表した。対象はLFM2.5-230M/350M/1.2B-Instruct/2.6B。教師モデルから量子化済み生徒モデルへ蒸留するQADにより、従来のPTQ Q4_0の品質低下を回復し、BF16平均精度の97%前後を維持すると報告。GPQA DiamondやMMLU-Proなど7種のベンチマーク平均(5回平均)で従来Q4_0を大幅に上回り、Q5_K_M/Q4_K_M並みの品質をより高いデコードスループットで達成。MacBook ProやGalaxy S26 Ultraなど4種の実機でも計測し、llama.cppで即利用可能。Hugging Faceで公開中。