NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / FLUX 3 Action
Black Forest Labs、ロボット向け世界行動モデル「FLUX 3 Action」7Bの重みを公開 — RoboLab-120で首位と発表
Black Forest Labsは2026年9月、動画・画像・音声で事前学習したFLUX 3派生のオープンウェイト行動モデル「FLUX 3 Action」を公開した。ロボット操作ベンチマークRoboLab-120で成功率42%台の首位、従来最良のCosmos 3 Nano比で最大3.95倍の高速化を公称。重みと技術レポートをあわせて提供する。
Black Forest Labsは2026年9月、ロボット制御向けの世界行動モデル(World Action Model)「FLUX 3 Action(F3A)」を発表した。マルチモーダル基盤「FLUX 3」から派生した70億パラメータのオープンウェイトモデルで、動画・画像・音声の大規模データ(特に動画を重視)で事前学習したうえ、動画と行動の同時予測に向けて適応させたものと説明している。重みと技術レポートをあわせて公開し、対象の機体(エンボディメント)と行動空間ごとのファインチューニング手順の透明化をうたう。以下は同社公式ページの整理であり、評価数値はすべて同社の公称値で、独立した検証は確認していない。
位置づけ — 動画理解を活かすWAMと軽量VLAの二者択一を解消する狙い
- 2つの流儀: 行動ポリシーには、動画と行動を同時予測する世界行動モデル(WAM)と、視覚言語行動モデル(VLA)があると同社は整理している。WAMはRoboLab等のベンチマークをリードする一方、動画予測分の系列長やガイダンス手法で計算コストが高く、VLAは軽いが成功率で劣るとしている
- F3Aの主張: 動画と行動の同時予測を保ったまま、単一ステップの7BチェックポイントでRoboLab上の既存オープン方策を上回り、Pi0.5(VLA)より速いとしている。小型化にはマルチモーダル事前学習「Self-Flow」と、ガイダンスパスを不要化しサンプリングを単一ステップまで減らす蒸留が寄与したと説明している
- 学習レシピの公開: 事前学習・中間学習からファインチューニング、行動予測向け推論最適化までの手順をレポートで公開するとしており、「ロボティクスでは重みと同じくらいファインチューニングの手順が重要」との立場を示している
- ゲームへの応用: 行動予測はロボット以外にデジタル環境にも拡張できるとして、ナビゲーション等の検証場にゲームを用いる取り組みにも触れている
評価 — RoboLab-120で成功率42%台を公称(いずれも同社報告値)
同社ページ掲載のRoboLab-120(高忠実シミュレーションの汎用タスク評価)における成功率は以下の通り。比較対象の数値も同社ページからの引用であり、独立評価ではない。
| モデル | タイプ | 成功率 | パラメータ |
|---|---|---|---|
| FLUX 3 Action | WAM(オープン) | 42.92%(表の最良値。本文ではguidance-distilledで42.2%±0.36、single-stepで38.3%±0.38) | 7B |
| Cosmos 3 Nano Policy | WAM(オープン) | 36.8% | 16B |
| π0.5 | VLA(オープン) | 28.0% | 3.3B |
| Cosmos 3 Edge Policy | WAM(オープン) | 22.9% | 4B |
- 速度の主張: FP8のベース+guidance-distilledチェックポイントで、FP8のCosmos 3 Nano比1.52〜3.95倍(consumer〜datacenter GPU横断)。Pi0.5比では動作1秒あたりのリアルタイム係数で1.34〜2.28倍の改善とし、予測ホライズンはF3Aが2.13秒、Pi0.5が1.0秒としている
- 注意点: 速度優位は「1呼び出しの遅延」ではなくリアルタイム係数での比較と注記がある。精度・速度条件や計測設定の詳細は同ページの推論効率の節を参照する必要がある
- 比較画像なし: 一次情報ページの性能比較チャート(Figure 1)はインタラクティブ表示で、埋め込み可能な静止のベンチマーク比較画像は確認できなかったため、本記事では数値をテキスト表で記載する
コスト試算とハイブリッド構成 — 推論モデルとの併用で1成功あたり8.77ドルと試算
- 単体比較(同社試算・H200を1時間3ドル換算): F3A単体は1成功あたり0.09ドル・2分弱、最大推論努力のGPT 6 Astra単体は1成功あたり13.47ドル・平均16分としている。F3Aはロボット動作の待ち時間中はほぼ待機し、同時並行で47ロールアウトをさばけるとも述べている
- ハイブリッド: 推論器(GPT 6 Astra)が普段はF3A等の効率的ポリシーに制御を委譲し、必要な場面だけ介入する構成では、全エピソードの90%を解きつつ1成功あたり8.77ドル・8分となり、最良の代替構成比で29%安く40%速いとしている。純粋な最大推論が最も高精度というトレードオフは残るとしている
- 提供形態: 「Download the weights」として重みを公開し、Hugging Face上のコレクションから入手できる。利用条件の詳細は配布ページ側の確認が必要で、本記事では断定しない
- 限界の明示: 全ポリシーが単独では解けないタスクが依然あることを同社自身も認めている。ベンチマーク結果はシミュレーション上のもので、実機での再現性は別途検証が必要