計算ノードの中心に浮かぶ青い推論コアの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / Microsoft AI

Microsoft AI、初のストリーミング音声認識モデルと多言語TTS 2モデルを発表

リアルタイム文字起こしの「MAI-Transcribe-2-Streaming」が外部評価で精度1位と主張し、60言語・100ミリ秒台の部分確定をうたう。多言語TTSの「MAI-Voice-2.1」と低遅延版「Flash」も同時提供し、FoundryやOpenRouter経由で利用できる。

Microsoft AIは2026年10月1日(米国時間)、同社初のストリーミング音声認識モデル「MAI-Transcribe-2-Streaming」と、2つの多言語テキスト読み上げモデル「MAI-Voice-2.1」「MAI-Voice-2.1-Flash」を発表した。聞き取り・判断・発話の往復を人の会話速度に収める音声エージェント向けの構成要素と位置づけられている。以下はMicrosoft AI公式発表の記載範囲の整理である。

MAI-Transcribe-2-Streaming — 終了を待たないリアルタイム文字起こし

  • 対応範囲: 60言語のリアルタイム文字起こしに対応し、話し言葉の言語の自動検出を継続的に行うとしている。
  • 部分確定の仕組み: 発話の終了を待たず、音声受信から100ミリ秒強で暫定の認識結果(partials)を出し、文脈が増えるにつれて修正しながら確定させるとしている。エージェントが文の途中から推論やツール呼び出しを始められる想定だ。
  • 外部評価の主張: 最終確定・暫定のいずれの文字起こし精度でも、第三者のモデル評価サイトArtificial Analysisで1位としている。また精度と遅延の評価ではパレート境界上に位置するとしている。いずれもベンダー側の主張であり、独立した検証ではない点に注意されたい。
  • 速度の主張: リアルタイムの書き起こしや字幕用途では、最も近い競合より2倍速く単語が表示されるとする社内評価結果を示している(ベンダー公称値)。
  • 料金: 年末まで1時間あたり0.54ドルの導入価格で提供するとしている。

MAI-Voice-2.1 / Flash — 23言語を同一ボイスで話すTTS

  • MAI-Voice-2.1: 同社で最も強い多言語TTSモデルと位置づけ、23言語・26ロケールに対応する。1つの「声」のまま英語・中国語・ドイツ語などを切り替えても、なまりを引きずらず母語話者らしい発音になるとしている。料金は100万文字あたり22ドル。
  • MAI-Voice-2.1-Flash: 同じ言語・話者対応を保ちつつ、高頻度・低遅延の用途向けに調整した版。45秒の音声を生成でき、端末間の遅延は150ミリ秒としている。推論は55%高速、競合に比べ約60%安価で、100万文字あたり15ドルが業界最安水準としている(いずれもベンダー公称値)。
  • 音声クローン: いずれも数秒の参照音声から全対応言語でのクローンに対応する一方、悪用防止の同意ガードレールを内蔵しているとしている。
  • 人らしさ評価の主張: 4,000人の聴取者によるチューリングテストで、MAI-Voiceが人間の録音と同等以上に人間らしいと評価された割合が50.3%だったとしている(ベンダー実施の評価)。

利用方法 — FoundryやOpenRouter、デモ「Chatter」

  • 提供経路: 3モデルともMicrosoft Foundry経由で利用でき、2つのVoiceモデルはOpenRouter経由でも利用できる。Vercel経由の提供も案内され、LiveKitは近日対応とされている。
  • 想定用途: 通話者の発話を話し終わる前から書き起こして応答する顧客対応エージェント、話しかけられた言語で同じ声のまま返す多言語アシスタント、教材・ロールプレイ・ナレーションなどの対話型学習・メディアが挙げられている。
  • デモ: 3モデルを組み合わせた動作例として、MAI Playground上の新デモ「Chatter」が用意されている。
  • 注意: 精度・遅延・価格の数値はすべて発表時点のベンダー公称値であり、実際の利用条件や地域対応は公式ドキュメントの確認が必要である。

出典