AIプロダクトの操作画面とモジュールを表す抽象ビジュアル
NAW / PRODUCTS 03

IMAGE: AI生成ビジュアル

PRODUCTS / Developer Tools

Transformers v5.19.0公開 — EmbeddingGemma 2統合とMoE・連続バッチまわりの破壊的変更

Hugging Face Transformers v5.19.0が10月6日(UTC)に安定版として公開。Googleのマルチモーダル埋め込みモデルEmbeddingGemma 2の新規統合に加え、MoEのrouter logits返却、OWL-ViT系クエリ選択、連続バッチ向けattention実装の変更など破壊的変更を複数含む。

Hugging Faceは2026年10月6日(UTC)、Transformers v5.19.0 を公開した。GitHub Releasesで発表された安定版(prerelease・draftではない)のマイナーアップデートで、Googleのマルチモーダル埋め込みモデルEmbeddingGemma 2の新規統合が目玉。MoEや連続バッチ(continuous batching)まわりの破壊的変更も複数含むため、該当機能の利用者は注意が必要だ。

新規統合 — EmbeddingGemma 2

  • モデル概要: EmbeddingGemma 2はGemma 4アーキテクチャ基盤のマルチモーダル埋め込みモデル。テキスト・画像・音声・動画を個別または組み合わせた入力として、768次元の共有ベクトル空間に符号化し、クロスモーダル検索・意味的類似度・クラスタリング・分類に使えると記載されている。
  • Matryoshka対応: Matryoshka Representation Learningにより、埋め込みを512・256・128次元に切り詰めて利用できる。
  • 省メモリ設定: 視覚・動画トークンの予算を設定でき、未使用のvision・audioタワーはロード時に無効化してメモリを節約できる。
  • 位置づけ: 前回のv5.18.0(NemotronH Omniなど4アーキテクチャ統合)に続くモデル拡充で、今回は埋め込みモデル1件の統合となっている。ドキュメントはモデル別ページで公開されている。

破壊的変更 — MoE・OWL-ViT・連続バッチ

  • MoEのrouter logits: routerがlogitを計算するすべてのMoEモデルで、output_router_logits=True の場合にlogitを返すよう統一された(Qwen3-MoE方式に準拠)。従来の出力に依存したコードは、新しい出力クラスからrouter logitsを読む形への確認が必要とされている。
  • OWLv2のクエリ選択: Owlv2ForObjectDetection.embed_image_query が、OWL-ViT流のヒューリスティクスではなく、元論文ノートブック通りオブジェクトネススコア最大のクエリボックスを選択するように変更された。画像ガイドのクエリ埋め込みや検出結果が従来と変わる可能性がある。
  • paged| プレフィックスの非推奨化: SDPAとflash attention向けの paged|sdpa・paged|flash_attention_2 といった指定は非推奨となり、連続バッチ利用時は通常のattention実装(sdpa・flash_attention_2)を指定する形に移行する。通常のflash・SDPA関数が連続バッチに直接対応し、paged|... 指定はそちらへリダイレクトされる。
  • 連続バッチ内部の変更: indexベースとblock-tableパスのキャッシュ更新が単一呼び出しに融合され、カスタムコードで個別の更新パスを呼んでいる場合は挙動変化の影響を受けると記載されている。

並列化・キャッシュ・その他

  • エキスパート並列: トークンディスパッチ実装が追加され、新しい ep_dispatch_experts プランルールで選択できる。Qwen3 MoEとMellumでは既定となり、EPサイズとTPサイズを一致させる要件が不要になった。Trainer もエキスパート並列で動作するよう改修され、PEFTアダプタのテンソル並列対応がドキュメントに追記されている。
  • キャッシュ: 量子化キャッシュの扱いを修正(generate がユーザーの cache_config を変更しない、QuantizedLayer.reorder_cache の修復)。DynamicCache と StaticCache が層ごとの設定(スライディングウィンドウ、attentionチャンクサイズ、conv状態、ヘッド数など)から初期化できるようになり、不均質なモデルへの対応が改善されている。
  • その他: CIのPythonバージョンが3.11に移行。非推奨パイプラインのリダイレクト整理、Qwen3-VLのチャンク化プリフィル修正、Minicpm 4.6Vの動画バッチ修正など多数の修正を含む。

出典