NAW / PRODUCTS 03
IMAGE: AI生成ビジュアル
PRODUCTS / Developer Tools
Transformers v5.18.0公開 — NemotronH Omni・HyperCLOVAX Vision V2など4モデル統合
Hugging Face Transformers v5.18.0が安定版マイナー更新として公開。NVIDIAのマルチモーダル推論モデルNemotronH Omni、NAVERのHyperCLOVAX Vision V2、ストリーミング話者分離のNemotron 3 Diarization、多言語検索のGTEを新規統合。
Hugging Faceは2026年9月30日(UTC)、Transformers v5.18.0 を公開した。GitHub Releasesで発表された安定版(stable、prerelease・draftではない)のマイナーアップデートで、音声・マルチモーダル・多言語検索にまたがる4つの新モデルアーキテクチャ統合が中心。ROCmや画像処理まわりの破壊的変更も含む。
新規統合:4アーキテクチャの概要
- Nemotron 3 Diarization: 「誰がいつ話したか」を判定するオープンウェイトのストリーミング話者分離モデル。ストリーミングとオフライン推論の両対応、最大8話者、話者の到着順に出力を整列する。80msの入力バッファから30.4秒のオフライン風バッファまで設定可能な遅延プロファイルを持つと記載されている。
- NemotronH Omni: NVIDIAのマルチモーダル推論モデル。NemotronHハイブリッドMamba-Transformer言語モデルにRADIO visionエンコーダとParakeetベースの音声エンコーダ(任意)を組み合わせ、テキスト・画像・動画・音声を単一の自己回帰モデルで共同推論する構成。
- HyperCLOVAX Vision V2: NAVERの視覚言語モデル。HyperCLOVA X言語モデル基盤とQwen2.5-VL visionエンコーダの組み合わせで、テキスト・画像・動画入力に対応し、組み込みのthinkトークンによるchain-of-thought推論が可能と記載されている。
- GTE: mGTE論文由来のBERT流双方向エンコーダで、絶対位置埋め込みをRoPEに置換し、ゲート付きMLPと残差後レイヤー正規化を採用した構成。Alibabaのgte系やSnowflakeのsnowflake-arctic-embed-m-v2.0の基盤アーキテクチャとされている。
破壊的変更と修正
- 破壊的変更: ROCm環境でのgpt-oss向けFlashAttention 3経路の変更、DETR系画像処理の高速化に伴う変更、indexersのlayer_type再マッピング、DINO系モデルの近代化など、🚨印の変更が6件記載されている。該当モデル・環境の利用者はリリースノートの確認が必要だ。
- 修正・改善: Hubトークナイザークラスの誤り修正、AutoImageProcessorがPillowのみ環境でtorchvisionを要求する問題の修正、GLM 5.3 Flashのチェックポイント保存名保持、XPU向けカーネル登録などを含む。
- 前回のv5.17.0(HYV4など6モデル統合)に続くモデル拡充リリースであり、今回は音声(分離・マルチモーダル)と多言語(HyperCLOVAX、GTE)が軸となっている。