全身ロボット制御
足先から指先までの全身ヒューマノイドロボットを制御し、視覚と言語を歩行、しゃがみ、手を伸ばす動作、操作のためのモーターアクションに変換します。
Gemini Robotics 2は、Google DeepMindのロボット向け物理AIモデル群です。全身制御、器用な操作、具現化推論、オンデバイス動作を組み合わせ、知覚・計画・実行を支援します。
Gemini Robotics 2は、Google DeepMindのロボット向け物理AIモデル群です。このサイトでは、全身制御、器用な操作、具現化推論、オンデバイス動作を組み合わせた、適応性の高いロボットのためのインテリジェンス層として位置付けられています。
この製品ページでは、関連する3つのモデルが紹介されています。Gemini Robotics 2はモーター制御用のvision-language-actionモデル、Gemini Robotics ER 2は高レベルの計画と人間とのコミュニケーション用のvision-languageモデル、Gemini Robotics On-Device 2はロボットハードウェア上でローカルに動作する効率的なVLAモデルです。これらはまとめて、さまざまなエンボディメントをまたいで知覚、推論、実行、連携を必要とするロボットを対象としています。
足先から指先までの全身ヒューマノイドロボットを制御し、視覚と言語を歩行、しゃがみ、手を伸ばす動作、操作のためのモーターアクションに変換します。
5本指ハンドと標準的なグリッパーの両方に高い器用さを与え、繊細な作業や梱包のような作業を含みます。
数分単位で多段階にわたるタスクを推論できるようにし、進捗を追跡しながらVLAモデルと連携して実行します。
複数のロボットが互いに通信し、仕事を分担して、1台では足りない共有ミッションを完了できるようにします。
ロボティックデバイス上でローカルに動作し、わずか数時間のデータで新しいロボットのエンボディメントにすばやく適応するよう設計されています。
ヒューマノイドロボットが自然言語の指示を受け、目的地まで歩き、必要に応じて曲がったりしゃがんだりして、対象のビンや棚に物体を置きます。
ロボットが5本指ハンドまたはパラレルグリッパーを使って、結び目を結ぶ、ジップロックを封をする、きつく詰めるといった細かな操作を行います。
ロボットが長いワークフローを計画し、各ステップが成功したかどうかを追跡し、必要に応じて再試行し、タスク完了まで続けます。
複数のロボットが同じ環境で連携し、それぞれの強みを伝え合い、仕事を分担して共有ミッションを完了します。
ローカルなロボット導入が、ネットワーク接続やクラウド遅延に頼らずに、新しいエンボディメントへモデルを適応させます。
Gemini Robotics ER 2は、具現化推論モデルです。物理世界を理解し、複数ステップのタスクを計画し、人間とコミュニケーションを取り、下位レベルのVLAモデルにモーター実行を引き継ぎます。
ソースによると、Gemini Robotics 2はロボット制御用のvision-language-actionモデルとして提供され、Gemini Robotics ER 2はGoogle AI StudioおよびGemini Enterprise Agent Platformのプライベートプレビューで利用でき、VLAモデルとOn-Deviceモデルは早期アクセスパートナー向けに提供されています。
ページでは、ER 2が推論、計画、進捗追跡、連携を担当し、VLAモデルがロボット上でモーター制御を行うワークフローとして説明されています。
オンデバイスモデルは、ロボティックデバイス上でローカルに動作するよう最適化されており、数時間分のデータで新しいロボットのエンボディメントへ高速に適応できるよう設計されています。
ソースでは、全身制御とグリッパーベースの器用なタスクで中程度から高い成功率が示されている一方で、マルチフィンガーの器用な操作は依然として難しいと記されています。