人型ロボットと自律エージェントの接続を表す抽象ビジュアル
NAW / AGENTS 02

IMAGE: AI生成ビジュアル

AGENTS / AGENTS & ROBOTICS

Generalist AI、GEN-1.5を発表 — 単一デモから数秒で学ぶ身体知の基盤モデル

Generalist AIは2026年8月19日、ロボット向け基盤モデル「GEN-1.5」を公開した。30秒の文脈窓に3〜12秒の単一デモンストレーションを入れるだけで勾配更新なしに新タスクを遂行するin-context学習と、1〜10回の勾配ステップで適応するfew-step適応が、8か月超の事前学習から創発したとしている。

Generalist AIは2026年8月19日(米国時間)、身体知(embodied intelligence)の基盤モデルGEN-1.5を発表した。同社ブログによれば、3〜12秒の単一デモンストレーションを30秒の文脈窓に挿入するだけで勾配更新なしに新タスクを実行する「one-shot in-context学習」と、1〜10回の勾配ステップで新タスクに適応する「few-step適応」が、8か月超にわたる大規模な物理経験からの事前学習の結果として創発したという。

動画出典: GEN-1.5 hero video (Generalist AI公式YouTube)

GEN-1.5 概要イメージ

出典: GEN-1.5: Embodied Foundation Models are One-Shot Learners — Generalist AI のOGイメージ

GEN-1.5とは — 8か月事前学習から創発したone-shot学習

  • モデル位置づけ: 人間のように「1回見ただけで新しい身体スキルを再現する」能力の萌芽を示すロボット向け基盤モデル。映像・センサ・言語・固有受容感覚を入力し、100Hzの行動軌道を生成する。
  • 事前学習エンジン: 同社が2年前から構築してきた物理経験のデータエンジンで学習。9か月前にGEN-0でスケーリング則、5か月前にGEN-1で99%超のタスク習熟と即興性の兆しを報告しており、GEN-1.5は並行して8か月以上連続で事前学習を継続したモデル。
  • 創発の経緯: ファインチューンに必要な勾配ステップを100回、10回、最終的に1回・1分データまで減らせることを確認した後、「勾配ゼロで文脈だけで学習できるか」を検証したところ、単一デモの挿入でも一定の成功が得られたとしている。in-context学習を明示的に学習させたわけではないという。
  • 文脈の扱い: 事前学習では連続したスパンをランダムサンプリングしており、物理プロンプトのような時間的断絶は学習時に存在しなかった。新タスクはデモ分布に合わせて設計されたものではないと説明している。

性能 — 10タスクでのin-contextとfew-step適応

  • 評価設定: 多様な10タスク(ジッパーの開閉、瓶の蓋開け、財布から紙幣を取り出す等)という、短ホライズンで原子的な把持操作に限定した条件。
  • In-context(勾配更新なし): 3〜12秒の単一デモを文脈に挿入するだけで**平均59%(±10%標準偏差)**の成功。場合によっては、同一デモで1〜5ステップの勾配適応を上回ることもある。
  • Few-step適応: 1タスクあたり5分間のデータ(約50デモ)で10勾配ステップで平均83%(±9%)。事前学習と同様のハイパーパラメータで勾配降下を適用。1ステップ・1分データの極限条件でも**66.5%**を報告し、バッチサイズや学習率を上げるとさらに改善するとしている。
  • 重み変化の小ささ: 10ステップの適応で重み変化は0.15%未満にとどまり、「新たな表現を構築するのではなく、既存の知識をわずかに再構成している」可能性を示唆。手法のハイパーパラメータ探索は行っていない「out of the box」の結果としている。
  • 比較画像について: 一次情報(公式ブログ)に他モデルとのベンチマーク比較チャートは掲載されておらず、数値は同社内の10タスク平均の報告値である。本記事では比較画像なしとしてテキストで性能を記載する。

身体的な汎化 — プロンプトの合成とsim-to-real

  • 物理プロンプトエンジニアリング: デモはハンドヘルドグリッパによる人手データか、ロボット自身のロールアウトで記録。単一プロンプトだけでなく、独立に記録した2つのデモを文脈に並べると、モデルが中間の再把持や体勢移動を自ら補完して連続行動を連鎖させる。完全な複合タスクのデモを収集せずとも、短い再利用可能なプロンプトを組み合わせて長めの行動をプログラムできる可能性を示す。
  • Zero-shot sim-to-real: 事前学習にシミュレーションデータは一切含まないにもかかわらず、シミュレータ内で記録したデモ(スクリプト方策やRLエージェント、人間の遠隔操作など)をプロンプトとして実機がタスクを遂行。異なるハンドや物体位置・サイズへの汎化も確認されたとしている。
  • Human-to-robot: 人間がロボットのカメラ前で手で行ったデモを見て、ロボットが直後に再現する身体を超えた転移も一部タスクで確認。
  • 物理的汎化の例: ブラシでブロックをボウルに掃き入れるタスクで5分ファインチューンしたモデルが、バナナをブラシ代わりに使ったり、塵取りでブロックをすくい上げて注いだり、複数ブロックの選別や両手での蓋回しなど、デモにない道具利用・戦略を即興したと報告。事前学習の近傍探索でも類似タスクは見つからなかったとしている。
  • 限界の明記: 対象はシンプルで短ホライズンなタスクに限られ、成功率も中程度であること、in-contextで習得したスキルはファインチューンより脆いことを同社は明記している。

出典