MODELS / 01
TIIが音声認識モデル「Falcon-ASR」を公開 — 16億パラメーター、アラビア語WER 20.92%を報告
UAEのTIIが2026年10月7日に発表した音声認識モデルFalcon-ASRを公式発表の一次情報から整理する。16億パラメーターの構成、アラビア語・首長国方言・英語の公称評価、単語タイムスタンプや5言語同一重み対応を解説。
TAG / TOPIC
「音声認識」に関するAIニュースと解説記事の一覧です。
05 STORIES
LATEST STORIES
MODELS / 01
UAEのTIIが2026年10月7日に発表した音声認識モデルFalcon-ASRを公式発表の一次情報から整理する。16億パラメーターの構成、アラビア語・首長国方言・英語の公称評価、単語タイムスタンプや5言語同一重み対応を解説。
MODELS / 01
Microsoft AIは2026年10月1日、初のストリーミング音声認識モデルMAI-Transcribe-2-Streamingと多言語TTSモデルMAI-Voice-2.1/MAI-Voice-2.1-Flashを発表した。60言語のリアルタイム文字起こし、23言語対応の単一ボイス、150ミリ秒の低遅延、料金と提供経路を一次情報に基づき整理する。
MODELS / 01
NVIDIAが2026年9月23日に公開したオープンモデルNemotron 3 Diarizationを一次情報から整理。100Mパラメータ・最大8話者、VoiceArena Diarization-Benchで14.72% DERの1位、前世代比の改善、遅延設定、学習データ、OpenMDW 1.1ライセンスを扱う。
MODELS / 01
AlibabaのQwenチームが音声モデル群Qwen-Audio-3.1を公開。Model Studioの公式ドキュメントで確認できたqwen-audio-3.1-realtime-plusの仕様と、2026年9月22日発効の音声系モデル値下げ通知の内容を一次情報中心に整理する。
MODELS / 01
Googleは2026年8月26日、音声文字起こし専用モデル Gemini 3.5 Transcribe を発表した。最も高精度な speech-to-text モデルと位置づけ、既に自社プロダクトで稼働。Gemini API経由でGoogle AI StudioとGemini Enterpriseでパブリックプレビューとして提供され、リアルタイムと録音音声の両対応をうたう。