計算ノードの中心に浮かぶ青い推論コアの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / Qwen

Alibaba Qwen、音声モデル群「Qwen-Audio-3.1」を公開 — ASR・TTS・リアルタイムの5モデル体制に

Alibaba CloudのModel Studioドキュメントで qwen-audio-3.1-realtime-plus(9月20日提供開始)が確認可能に。262,144トークンのコンテキスト、8つの新システム音声、Function CallingやWeb検索、音声クローニングに対応。9月22日からは音声系モデルの値下げも適用された。

AlibabaのQwenチームは2026年9月、音声モデル群「Qwen-Audio-3.1」を公開した。Qwen公式アカウントの発表によれば、音声認識(ASR)、音声合成(TTS)、リアルタイム対話の刷新に加え、音声生成向けのTTS-Nextと音声理解向けのASR-Nextという2つの新モデルを含む5モデル体制で、理解・生成・対話・創作を網羅する音声スタックと位置づけている。以下は公式ドキュメントと公式通知で確認できた範囲の整理である。

確認できたモデル — realtime-plusは9月20日提供開始

  • モデルID: qwen-audio-3.1-realtime-plus がAlibaba Cloud Model Studioの公式リリース一覧に掲載されている。対象はInternational(シンガポール)で、日付は2026年9月20日。
  • 互換性: 3.0 Plusと同じ統合プロトコル(WebSocket / WebRTC / AOQ)で利用でき、既存の音声を維持したまま8つのシステム音声が追加された。
  • コンテキスト: 262,144トークンのコンテキストウィンドウを持つ。
  • 機能: Function Calling、Web検索、音声クローニング(voice cloning)に対応する。全二重(デュプレックス)のリアルタイム音声会話モデルと説明されている。
  • その他4モデル: 公式X投稿はASR・TTS・Realtimeの刷新とTTS-Next(音声創作向け)、ASR-Next(音声理解向け)の追加をうたっているが、各モデルのID・仕様の詳細は今回確認したModel Studioドキュメントの範囲では一覧化されていない。利用時はModel Studioのモデル一覧でIDを直接確認したい。

値下げ — 9月22日発効の公式通知

  • 発効日時: Alibaba CloudのModel Studio公式通知によれば、北京时间2026年9月22日00:00(UTC+8)から、国際站シンガポール/北京リージョンの音声系モデル単価が引き下げられた。
  • qwen-audio-3.1-tts-flash: 入力が0.23ドル/百万トークン、出力が1.87ドル/百万トークンという新単価が通知に記載されている。
  • qwen-audio-3.0-realtime-flash: 入力テキスト0.45→0.23ドル/百万トークン、入力音声4.5→0.93ドル/百万トークン、出力テキスト4.5→0.70ドル/百万トークン、テキスト+音声出力15→1.87ドル/百万トークンへ引き下げられた(いずれも百万トークンあたり、公式通知の新旧対照表による)。
  • 公式の値下げ幅の主張: Qwen公式アカウントの投稿は「TTSで約70%オフ」を含む大幅値下げをうたっている。個別ワークロードの実効コストは利用形態で変わるため、見積もりは通知の単価表で確認したい。

限界と注意点

  • 性能比較の扱い: Qwen-Audio-3.1のベンチマーク比較チャート等の画像は、今回確認した一次情報(Model Studioドキュメント・値下げ通知・公式X投稿)の範囲では確認できなかった。本記事に性能比較画像は含めない。精度や他モデル比較の数値は断定しない。
  • API提供形態: 確認できたモデルはModel Studio(Alibaba Cloudの大模型服务平台・百炼)経由のAPI提供が中心で、オープンウェイトの有無は今回の一次情報では確認できていない。
  • 料金の単位に注意: 通知の新旧単価は単位が異なる箇所(万文字/百万トークン)がある。コスト試算では単位を揃えて確認したい。

出典