NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
Alibaba Cloudが「Qwen3.8-Omni-Flash」のドキュメントを公開 — 100万トークンの音声・動画理解モデル
Alibaba Cloudは2026年9月18日更新のModel Studioドキュメントで、音声・動画理解とコンテンツ分析向けモデル「qwen3.8-omni-flash」を掲載した。テキスト・画像・音声・動画を入力として受け付け、テキストを出力する。コンテキストウィンドウは100万トークン、推論(Thinking)は既定で有効、Function CallingやWeb検索、コンテキストキャッシュに対応する。
Alibaba Cloudは2026年9月18日更新のModel Studioドキュメントで、音声・動画理解とコンテンツ分析向けのモデル**「qwen3.8-omni-flash」**を掲載した。テキスト・画像・音声・動画の4種類を入力として受け付け、テキストを出力するモデルで、推論サービスの提供者はAlibaba Cloud Model Studioとされている。Chat CompletionsまたはResponsesのいずれのAPI形式でも利用できる。
100万トークンのコンテキストと入出力仕様
- コンテキストウィンドウは100万トークン。最大入力長は非Thinkingモードで991,808トークン、Thinkingモードで983,616トークン、最大出力長は131,072トークンと記載されている。
- Thinking(推論)は既定で有効で、推論量(reasoning effort)を調整できる。用途に応じて推論の深さを変えられる設計になっている。
- 音声入力は113の言語・方言に対応し、Qwen3.5-Omniと同等とされている。マルチチャネル音声(空間音声)の入力にも対応し、Chat Completionsでは
use_multichannelで有効化する。
エージェント利用を意識した機能群
- Function Callingに対応し、カスタムのツール呼び出しができる。エージェント用途での外部ツール連携が前提になっている。
- Web検索に対応し、Responsesの組み込みツール
web_searchとして利用できる。 - コンテキストキャッシュに対応し、自動の暗黙的キャッシュとResponsesのセッションキャッシュの両方を備える。長い音声・動画の繰り返し参照がある用途での効率化が見込まれる。
- 提供リージョンは**中国(北京)、シンガポール、中国(香港)、日本(東京)、ドイツ(フランクフルト)、米国(バージニア)**の6か所で、選択したリージョンのAPIキーを使用する。推論料金とレート制限の詳細はドキュメント内の料金・制限ページを参照する形になっている。