NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
Rekaが19Bオムニモデル「Rho-1」を研究プレビュー公開 — テキスト・画像・動画・ロボット動作を単一ネットワークに統合
Reka AIが2026年10月5日、19Bパラメーターのオムニ推論モデルRho-1の研究プレビューを発表した。テキスト・画像・動画の理解と生成、推論、ロボット動作を単一ニューラルネットワーク内のトークンとして統一し、ツール呼び出しや外部モデルへの委譲なしに5ターンの一貫セッションを実演した。H100・320基×3か月でゼロから学習した概念実証と位置づけられ、重み・API・価格の公開条件は未公表。
Reka AIは2026年10月5日(現地時間)、19Bパラメーターのオムニ推論モデル Rho-1 の研究プレビューを発表した。テキスト・画像・動画の理解と生成、それらに対する推論、そして行動(ロボット動作)を単一ニューラルネットワークの中に統合し、モダリティごとに専門モデルへ委譲するエージェント型パイプラインを「折りたたむ」設計を掲げる。本稿は同社の公式発表ページで確認できる範囲に限定して整理する。
単一ネットワークへの統合 — 理解ストリームと生成ストリーム
- 構成: 19Bパラメーター、ゼロから学習した単一ニューラルネットワーク。テキスト・視覚・ロボット動作を単一コンテキストウィンドウ内のトークンとして統一する
- 二つのストリーム: 理解ストリームと生成ストリームが注意機構(アテンション)と表現空間を共有する。画像生成の要求は拡散(diffusion)側へ、物体位置の特定は理解側で処理されるが、どちらのターンも同じKVキャッシュを読み書きし、KVキャッシュが永続的な世界状態として働くと説明されている
- 二つのヘッド: テキストヘッドが次のトークンを予測し、拡散ヘッドがノイズからクリーンな画像・映像への復元を担う
- ツール呼び出しなし: 公式ページによれば、テキスト・位置枠・画像・動画はすべて一つの状態から読み書きされるトークンであり、「ツール呼び出しも第二のモデルもない」としている
- 実演: 灯台の静止画を描き、その位置を枠で示し、動画化し、吹雪の天候へ編集し、二つの動画の差分を説明する5ターンの未編集セッションを単一モデルで通して実行したとしている
世界モデルとロボティクス — 実時間ステアリングと行動トークン
- 生成速度の公称値(いずれもベンダー報告): ベースモデルは中央値で実時間の 0.79倍速 で動画を生成し、視聴可能なストリームはおよそ6秒で開始するとしている。測定条件の詳細は発表ページに記載がない
- 操縦可能な実時間世界モデル: クリップごとに前回の続きから生成を続け、シミュレーション内の時間を止めずに途中で指示を差し込める設計と説明する。自動運転のベンチマークや具身(embodied)ポリシーの学習向けに、反応的な環境をその場で立ち上げて外乱を与えられる応用を想定している
- 世界-言語-行動モデル: 物理動作と未来の動画フレームが同じ潜在状態からデコードされるため、ポリシーが環境の数秒先を心的にシミュレーションして実行軌道を出力できるとしている。動作はテキストや画素と並ぶ連続トークンとして扱われ、ロボティクス用の場当たり的なラッパーは不要だと主張する
- 学習規模: 公開ページのすべての結果は H100・320基×3か月 でゼロから学習したチェックポイントによるもので、現代のフロンティア言語・動画モデルの計算量のごく一部だとしている。同社はRho-1を「完成品ではなく機能的な概念実証であり、アーキテクチャの方向性」と明言している
提供条件と未公表事項 — ベンチマーク比較なし
- 提供形態: 現時点では研究プレビューとしての提供で、具身ロボティクスやインタラクティブシミュレーション、クローズドループの視覚-行動システムの構築者との協業を受け付けている
- 未公表: 重みの公開有無、API提供、価格、ライセンス、評価用ベンチマークの数値比較は発表ページに記載がない。同ページに他モデルとの性能比較チャートや表は掲載されていないため、本稿では数値の断定を行わない
- システム面の課題: 推論・マルチモーダル生成・視覚グラウンディング・モーター制御を一つの重みに束ねると、自律的なテキスト生成向けの従来型LLMサービング基盤では足りなくなり、連続的な拡散軌道と離散的な自己回帰デコーディングの混在が新たなランタイムのボトルネックになるとしている。最適化は今後の研究課題だ