MODELS / 01
Microsoft AI、初のストリーミング音声認識モデルと多言語TTS 2モデルを発表
Microsoft AIは2026年10月1日、初のストリーミング音声認識モデルMAI-Transcribe-2-Streamingと多言語TTSモデルMAI-Voice-2.1/MAI-Voice-2.1-Flashを発表した。60言語のリアルタイム文字起こし、23言語対応の単一ボイス、150ミリ秒の低遅延、料金と提供経路を一次情報に基づき整理する。
TAG / TOPIC
「音声エージェント」に関するAIニュースと解説記事の一覧です。
02 STORIES
LATEST STORIES
MODELS / 01
Microsoft AIは2026年10月1日、初のストリーミング音声認識モデルMAI-Transcribe-2-Streamingと多言語TTSモデルMAI-Voice-2.1/MAI-Voice-2.1-Flashを発表した。60言語のリアルタイム文字起こし、23言語対応の単一ボイス、150ミリ秒の低遅延、料金と提供経路を一次情報に基づき整理する。
AGENTS / 02
TencentのHunyuan Speech Teamらが、全二重のマルチモーダル・インタラクションエージェント「Gander」をオープンソースで公開した。MiniCPM-o 4.5を基盤とし、Cerebellum-Brain協調アーキテクチャと非同期エージェントループにより、会話を続けながら裏でタスクを実行できる。論文はarXiv:2609.08977、モデルはHugging FaceでApache-2.0ライセンス。