青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / Cloudflare

Cloudflare、マルチモーダル決定モデル「Clef-omni」を公開 — 音声・動画・画像・テキストを単一APIで判定

Cloudflareは2026年10月9日、オープンウェイトの決定モデル群Clefに新モデルClef-omniを追加した。音声と動画をテキスト・画像と合わせて単一API呼び出しで処理し、重みはHugging Faceで公開。同時にClef-flashの値下げとClefの高速化も発表した。

Cloudflareは2026年10月9日(米時間)、オープンウェイトの決定モデル群「Clef」に新モデル「Clef-omni」を追加したと発表した。先週のClef / Clef-flash公開に続くもので、音声と動画の入力に新たに対応する。同時にClef-flashの値下げとClefの高速化も発表している。以下は公式ブログと開発者ドキュメントの内容整理である。

Clef-omni — 音声・動画を含む4モダリティを単一呼び出しで判定

  • 対応入力: テキスト・JSONに加え、画像(PNG/JPEG/WebP、最大4枚)、音声(wav/mp3、最大4件・各300秒まで)、動画(mp4/webm、最大2件・各60秒まで)を単一API呼び出しで受け付ける。動画は毎秒2フレームでサンプリングし、音声トラックと合わせて判定する。
  • モデルの位置づけ: 自由文生成を行わない「決定モデル」で、状態(state)と型付きの問い(noul/choice/score、最大64問)を受け取り、選択肢ごとの確率を返す。音声の書き起こしや画像のキャプション化といった前段パイプラインが不要になるとしている。
  • 基盤: Qwen3-Omni-30B-A3B-InstructのMixture-of-Experts基盤(公開情報では30Bパラメータ・動作時3B)を採用し、理解系のバックボーンを使う一方、音声合成系の重みは使わない。Qwen3バックボーンを凍結しLoRAで学習、ラベル平滑化交差エントロピーとBrierスコア較正を組み合わせたポストトレーニングとしている。
  • 速度(いずれもベンダー公称): テキストのみ中央値約130ミリ秒、画像入力約150ミリ秒、音声クリップは数百ミリ秒、音声付き21秒動画クリップは約1.5秒で判定するとしている。
  • 提供形態: Workers AI(モデルID @cf/cloudflare/clef-omni、コンテキスト64k、100万入力トークンあたり0.15ドル)でホスト提供し、重みはHugging Face(Cloudflare/clef-omni)で公開。Jev API互換で、AI Gateway経由でも利用できるとしている。

価格改定と高速化 — Clef-flash値下げ、Clefは最大2倍高速に

  • Clef-flashの値下げ: 100万入力トークンあたり0.09ドルから0.038ドルに引き下げ、Jevより安価になったとしている。引き換えにホスト版のコンテキストウィンドウは従来の64kから24kに縮小する。Hugging Face上の重み自体は256k対応のままで、セルフホストでは変わらないとしている。
  • 根拠の説明: 自社の利用データでは24kトークンを超えるリクエストは0.24%のみとして、その分析に基づく判断と説明している。大きなコンテキストが必要な用途にはClef(64k、0.24ドル/100万入力トークン)への切り替えを推奨している。
  • Clefの高速化: モデル重みの変更はなく、サービング基盤の最適化によるものとしている。SGLangへの移行(SGLang 0.5.22向けの対応PR含む)を挙げ、約800トークン入力で中央値262ミリ秒から152ミリ秒(1.7倍)、約3,400トークンで616ミリ秒から305ミリ秒(2.0倍)、約16,000トークンで2,721ミリ秒から1,635ミリ秒(1.7倍)としている(いずれもベンダー公称)。

評価結果と社内利用 — 公称ベンチマークと注意点

  • 汎用ベンチマーク(ベンダー報告値、Clef-omni): BFCL case exact 98.2、ToolRet nDCG@10 66.6、API-Bank accuracy 92.7、When2Call accuracy 63.3、BANKING77 macro-F1 94.8、CLINC150+OOS macro-F1 97.7、BRIGHT nDCG@10 42.0、Amazon ESCI macro-F1 57.8、PhishNChips accuracy 73.2。Home appliances case exactは69.3で、同系列のClef-flash(97.73)を下回る項目もある。
  • TypeSafe evals比較(ベンダー報告値): 請求書処理の完全一致でClef-omni 60.2(Clef 64.7、Jev 61.8)、カスタマーサービスの完全一致で71.6(Clef 76.3、Clef-flash 77.0、Jev 76.0)など、項目により優劣が分かれる。When2CallではJev(80.97)がClef-omni(63.3)を上回っている。
  • 注意: 上記の数値・速度・価格はいずれもCloudflareの公称値で、独立した第三者評価は確認していない。導入判断には自前の評価が必要である。
  • 社内利用例: 公開GitHubドキュメントリポジトリでのスパムIssue検出と自動クローズ、コンテンツ管理系でのプラグイン審査、データ損失防止チームでの個人識別情報スキャン、脅威インテリジェンスでの悪性ドメイン検出を挙げている。

出典