NAW / AGENTS 02
IMAGE: AI生成ビジュアル
AGENTS / AGENTS
Tencent混元音声チームらが全二重音声エージェント「Gander」をオープンソース公開 — 話しながら裏で作業するCerebellum-Brain構造
MiniCPM-o 4.5を基盤に、リアルタイムの会話応答を担うCerebellumと高度な推論・エージェント実行を担うBrainを組み合わせた全二重インタラクションエージェント。応答の途中割り込みや先回りの確認・質問に対応し、モデル・コードとともにApache-2.0で公開された。
TencentのHunyuan Speech Teamらによる研究プロジェクト「Gander」が、全二重(フルデュプレックス)のマルチモーダル・インタラクションエージェントとしてオープンソースで公開された。日常会話から、長時間の作業を伴うエージェント利用まで、ストリーミング入力を連続処理しながら自然な音声対話を続ける設計が特徴だ。論文はarXiv(2609.08977、2026年9月8日公開、v3は9月12日改訂)で読め、コードとモデルも公開されている。
Ganderの概要
- 論文題は「Multimodal Duplex Interaction Agent」。著者所属の筆頭はHunyuan Speech Team, Tencentで、浙江大学・上海交通大学・香港中文大学・南洋理工大学が名を連ねる
- 基盤モデルはMiniCPM-o 4.5で、リアルタイム対話向けに適応させた「ネイティブなマルチモーダル全二重インタラクションモデル」と位置づけている
- 従来のターン制ではなく、ユーザーの音声・映像・テキスト入力をストリーミングで連続処理する
- ユーザーは応答の途中でも割り込め、モデル側も中間フィードバックの先出しや確認の質問を能動的に行える
- 背景雑音の干渉、多人数の会話、相づち(バックチャネル)といった難しい対話場面への対応も想定している
- GitHubリポジトリのNews欄によれば、2026年9月9日に正式リリースされた
Cerebellum-Brain協調と非同期エージェントループ
- 中核は「Cerebellum-Brain協調フレームワーク」。Cerebellumがリアルタイムの知覚・対話応答を担い、Brainが複雑な推論と高次のエージェントタスクを担う
- 両者はツール呼び出しとエージェント編成ランタイムを通じて継続的に連携し、会話を続けながら裏で長時間タスクを実行できる
- Cerebellumはストリーミング型のThinker-Talker構造で、ユーザー入力とモデル出力をチャンク単位で順序付きトークン列に平坦化し、低遅延な連続対話を実現する
- 会話能力・対話能力・理解力・ツール支援タスク実行で評価され、ターンテイキング能力や音声QAなどで良好な結果が得られたと報告している(著者らの評価であり、独立検証ではない)

出典: Omni-Interaction-Gander/Omni-Interaction-Agent - GitHub(docs/assets/brain-cerebellum-runtime.png)
公開物とライセンス
- コードはGitHub(Omni-Interaction-Gander/Omni-Interaction-Agent)で公開。プロジェクトページとデモも用意されている
- モデルはHugging Face(Gander-Omni/Gander)で公開され、ライセンスはApache-2.0、ベースモデルはopenbmb/MiniCPM-o-4_5と記載されている
- データセットは「オープンソース公開の手続き中で近日公開予定」(2026年9月10日時点の告知)とされており、本記事執筆時点で取得可能かは未確認のため断定しない
- 評価の主眼はツール支援設定に置かれており、より長期のエージェントタスクや多様な実運用条件は今後の課題と論文内で明示している