人型ロボットと自律エージェントの接続を表す抽象ビジュアル
NAW / AGENTS 02

IMAGE: AI生成ビジュアル

AGENTS / Agents

StanfordとCaltech、ヒューマノイド自律システム「HomeBody」を公開 — GPT Astraが未見のキッチンで片付けと薬の取出し

StanfordのThe Movement LabとCaltechの研究チームが、フロンティアVLMにヒューマノイドの身体を与えるシステム「HomeBody」のプロジェクトページを2026年9月に公開した。Unitree G1がGPT Astraの誘導で未見のキッチンを探索・記憶し、コーヒーバッグの片付けや見えない場所にある薬の取出しを行う。学習済みVLAを挟まず、持続的な空間メモリと再利用可能なスキル群をVLMが直接呼び出して組み立てる構成が特徴。論文とコードは近日公開としている。

Stanford大学のThe Movement Lab(TML)とCaltechの研究チームは、フロンティアの視覚言語モデル(VLM)にヒューマノイドの身体を与えるシステム**「HomeBody」のプロジェクトページを2026年9月に公開した。実演ではUnitree G1がGPT Astraの誘導で、事前に見たことのないキッチン**を片付け、視界にない薬を取り出して人に手渡す。以下はプロジェクトページとGitHubリポジトリの記載内容の整理であり、査読付き論文や独立した性能評価ではない。論文(Paper)とコード(Code)はいずれも公開時点で「近日公開(Coming soon)」とされている。

HomeBodyの概要:探索とシーンデータ収集、キッチンの再構築、実世界でのヒューマノイドスキルの実行

出典:HomeBody: A Humanoid That Explores, Remembers, and Acts on Its Own(画像は同プロジェクトページおよびGitHubリポジトリ公開の概要図)

何をしたか — 未見のキッチンでの片付けと薬の取出し

  • 実施者: Gio Huh氏(Caltech)、Cayden Gu氏・Takara E. Truong氏(Stanford)、指導はC. Karen Liu氏・Guy Tevet氏(Stanford、均等貢献)と記載されている。
  • 機体とモデル: Unitree G1を「GPT Astra」に誘導させると説明している。フロンティアVLM(Astraなど)が高性能化したいま、高度な推論とロボットのスキルの間に学習済みVLAがなお必要かを問う問題設定だ。
  • 実演1(キッチンの片付け): 「コーヒーバッグをすべて集めて中央に置き、傷んだミルクとオレンジジュースのカートンを捨てる」という指示に対し、島(アイランド)への収集と指定カートンの廃棄を、部屋を横断する複数回の移動・把持・配置で遂行するとしている。
  • 実演2(薬の取出し): 「薬を忘れたので取ってきてほしい。ついでに傷んだカートンも捨てて」という曖昧な要求に対し、保存したキーフレームから引き出しを特定し、右手で引き出しを開けて薬を取り出して人に手渡し、左手でカートンを廃棄する。薬は当初は視界外にあったとしている。
  • 前提条件の説明: 環境固有の訓練データや追加の方策学習なし(without environment-specific training data or additional policy learning)で動作させたとしている。

構成の主張 — VLAを挟まずVLMがスキル群を直接呼ぶ

  • 従来構成との対比: 一般的なヒューマノイド自律の三層構成として、System 2のVLMが観測と指示を処理し、学習済みSystem 1のVLAがコマンドを生成し、System 0のコントローラが協調運動を実行する流れを紹介している。
  • HomeBodyの置き換え: その連鎖を、プラグアンドプレイのVLMが再利用可能なモータースキルのライブラリを直接呼び出す形に置き換えると説明している。学習済みの行動パイプラインを学習し直すのではなく、持続的な空間メモリと合成可能なヒューマノイドスキルをフロンティアVLMに備えさせる方式だ。
  • 空間メモリの役割: 自我視点(ego view)に映る物体と記憶した場所を結ぶ内部の空間モデルを持ち、曖昧な要求の解釈、移動先・操作対象・歩行と操作の順序付けに使うとしている。動作や遷移が失敗した際は実行フィードバックをもとにVLMが次の判断を修正する。
  • 検証状況の注意: ページ上で成功率などの定量評価は示されておらず、比較対象への優劣も主張されていない。ここでの記述は設計の説明であり、効果の実証として読むべきではない。

導入手順 — 探索、Real2Sim、日常指示での実行

  • 手順1(探索): まず「あなたはキッチンロボットです、この空間を探索してください」といった指示で未見の環境を探索させる。iPhone動画、D435iカメラ観測、SLAM付きLiDARスキャン、関節姿勢、Astraが選んだウェイポイントを収集し、物体が自我視点から外れても文脈を保持するとしている。
  • 手順2(Real2Sim): AstraをReal2Simエージェントとして使い、ヒューマノイド自身が収集したデータからIsaac Sim上にデジタルツインを構築する。SLAMの形状、自我視点、関節状態、ウェイポイントに基づくことで、幾何・意味・見た目の面で正確な双子を作り、自我視点を超えた場所の推論に使うとしている。ページ上ではLiDARとシミュレーションの重ね合わせ比較も提示されている。
  • 手順3(日常指示): 「キッチンを片付けて」といった日常の指示を与えるだけで、行動レベルの台本なしに空間文脈から行動と対象を選ぶとしている。デジタルツイン上での例示的な片付けの再生デモもページ内に用意されている。
  • 公開物の現状: 論文は「Coming soon」、GitHubリポジトリ(Stanford-TML/homebody)は公開済みだがREADME上で「Code coming soon」と記載されている。実装の詳細や再現手順は現時点では確認できない。

出典