NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / Tavus
Tavus、対面会話モデル「Griffin」を発表 — 1分間のビデオ通話で48%が人間と誤認と報告
音声と映像を同時に処理・生成する全二重のvideo-to-videoモデル。720p映像を320msチャンクでリアルタイム生成し、H100上で音声→映像の遅延は平均0.43秒としている。自社実施の対面試験では参加者の48%が相手を人間だと思ったと報告している。
サンフランシスコのTavusは2026年10月1日、対面の人間的やり取りを理解・生成する新しいモデルクラス「Human Interaction Model(HIM)」の第一弾「Griffin」(プレビュー版はGriffin-Lite)を発表した。音声認識→言語モデル→音声合成を順につなぐカスケード方式ではなく、相手の音声と映像を知覚しながら話す最中も聞き続け、発話・表情・視線・身振りを同時に生成する全二重(full-duplex)のvideo-to-video方式を特徴とする。以下は同社公開ページの記載内容の整理であり、評価数値はすべて同社の報告値である。
仕組み — 会話モデリングと音声・映像生成の並行動作
- 二部構成: (1) 相手の音声・映像を知覚し、いつ・どう応答するかを決めるContinuous Conversational Modelingエンジンと、(2) その信号を音声と映像に変換するAudio-Visual Generationエンジン(Streaming Speech Generation+Streaming Video Generation)で構成される。
- 継続的な判断: ターン終了を待たず、サブ秒単位の間隔で会話状態を評価し、発話・保持・譲歩、割り込みへの対応、相づちや非言語キューを決めるとしている。考え中の沈黙をターン終了と誤認せず、相手の発話中にうなずくといった振る舞いが可能になると説明している。
- 音声側: 48kHz音声を連続潜在(1フレーム40値・毎秒100フレーム・コードブックなし)に写像する畳み込みオートエンコーダー「Tavec」と、話者プレフィックス(10秒程度のクリップから声を複製できる)に条件づく自己回帰拡散Transformer(VDiT)で、発話全体の完成を待たずにストリーミング再生するとしている。
- 映像側: 参照写真1枚+ストリーミング音声・制御信号から潜在を1つずつ生成する少数ステップの自己回帰拡散モデルで、VAEが時間を8倍圧縮するため25fpsでは1潜在=8フレーム=320msとなり、720p映像を320msチャンクでリアルタイム生成するとしている。大規模な双方向・多ステップ拡散モデルを分布マッチング蒸留→teacher forcingによる自己回帰化→Self-Forcing学習の3段階で変換したと説明している。
評価 — 遅延・VideoFDB・対面試験(いずれも自社報告)
- 音声→映像の遅延: 音声受信から映像への反映までの真の遅延はH100上で平均0.43秒で、先行音声待ち(lookahead)を持つ方式の約半分としている。
- VideoFDB生成部門: Griffin-Liteは3.83で、次点より1ポイント以上高く、人間参照の3.92まで0.09差としている。
- VideoFDB知覚部門: Griffin-Liteは3.73で、最強の次点を0.29ポイント上回り、人間参照の4.20を0.47下回る水準とし、評価対象15モデル中で最も知覚的だったとしている。
- 対面試験: 独立した調査プラットフォーム経由で集めた参加者に「別の参加者と1分間のビデオ通話」と伝え、実際はGriffin-Liteで動くPALと通話させたところ、54人中26人(48%)が相手を人間だと思ったとしている。同一手順の従来構成(Phoenix-4.5+Sparrow-2+Raven-1)では41人中1人(2.4%)だったとしている。
- 注意: いずれも同社自身の実施・報告による値であり、独立した第三者評価ではない。試験の話題(今年楽しみにしていること等)や参加者構成などの条件は同社ページの記載範囲に限られる。
提供と安全性 — プレビューと慎重な公開方針
- 提供形態: 公開ページはGriffin-Liteをプレビューとして紹介している。料金・API提供条件などの詳細は本記事執筆時点で同ページの記載範囲からは確認できないため扱わない。
- 安全性: 同社はGriffin-Liteを初のビデオチューリングテスト合格モデルと位置づけたうえで、リスクと公開戦略には慎重であるべきだと記載している。具体的なセーフガードの内容は同ページの記載範囲に限られる。
- 文脈: 同社の既存モデル群(描画のPhoenix-4.5、知覚のRaven、ターン制御のSparrow)を統合した位置づけと説明されている。