NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / Black Forest Labs
Black Forest Labs、画像モデル「FLUX 3 Image」を公開 — 境界ボックスで構図を直接指定
0〜1000グリッドの境界ボックスと要素表で配置・編集箇所を指定し、触れていない領域を保ったまま多段階編集できる。最大10枚の参照画像の合成、ネイティブ2K・4K生成に対応し、PlaygroundとBFL APIで提供する。
Black Forest Labs(BFL)は、マルチモーダルモデルFLUX 3ファミリーの画像生成・編集を担う「FLUX 3 Image」の提供を開始した。テキストプロンプトだけでなく、0〜1000のグリッド上で引いた境界ボックス(バウンディングボックス)で各要素の配置を直接指定できるのが特徴で、編集では触れていない領域を保ったまま狙った箇所だけを変えられるとしている。以下は公式モデルページの内容の整理であり、性能の主張はすべて同社の提示によるものだ。
何ができるのか — 箱で構図を指定する画像生成
- レイアウト指定: 画面を縦横とも0〜1000のグリッドとみなし、重要な要素ごとにボックスを引いて中身を記述する。各ボックスは
[y_min, x_min, y_max, x_max]形式で、id・ボックス・説明文からなる要素表(JSON配列)と、全体を1段落で束ねるキャプションを添える。 - ボックスの扱い: プロンプトアップサンプラーが短い指示をFLUX 3向けの濃いキャプションに展開するが、ユーザーが描いたボックスはidも座標もそのままモデルに渡されるとしている。
- 参照画像の合成: 最大10枚の参照画像を
ref_image_0からのトークンで引用し、1枚の構図に合成できる。配置と大きさはモデルが決める。 - 高解像度: ネイティブ2K・4Kで生成し、質感や顔、色の細部を保つとしている。作例として5456×3072ピクセル(16.8MP)の全モデル生成画像と、その看板文字・提灯・食器などの拡大比較を示している。
編集とエージェント利用 — 触れていない画素は変えない
- 画素単位の編集: 完成画像の任意箇所を編集でき、複数の狙った編集を同時に実行できる。触れていない部分は変更前とまったく同じに保たれるため、ラウンドを重ねても画像が崩れないとしている。
- エージェント向け設計: 画像レイアウトの理解を前提に学習されており、1行の指示とアスペクト比だけからLLMがキャプションと要素表を計画し、各ボックスを人間が後から移動・調整できるワークフローを想定している。
- 提供形態: ブラウザのPlaygroundで手描きのボックス指定、またはBFL APIへのレイアウトプロンプト送信で利用できる。大規模に自社基盤で運用する企業向けに商用ウェイトライセンス(ファインチューンと自社デプロイ可)も用意されている。
受け止めの注意点 — 定量ベンチマークの提示なし
- 比較画像なし: 公式モデルページに、他モデルと比較したEvaluation Results・ベンチマークの性能比較チャートや表は掲載されていない。本記事では性能数値の断定を避け、機能の説明に限定している。
- 確認できた事実: 「FLUX 3 Image」という名称での提供、境界ボックスによる構図指定、最大10枚の参照画像合成、画素単位の多段階編集、ネイティブ4K生成、Playground・API・商用ウェイトでの提供は公式モデルページで確認できる。
- 独立評価なし: 画質や指示追従の主張はBFL自身の提示であり、第三者の独立評価や定量ベンチマークは公式ページに示されていない。