Gemini Robotics 2

認証する

Gemini Robotics 2は、Google DeepMindのロボット向け物理AIモデル群です。全身制御、器用な操作、具現化推論、オンデバイス動作を組み合わせ、知覚・計画・実行を支援します。

Gemini Robotics 2 preview

概要

Gemini Robotics 2は、Google DeepMindのロボット向け物理AIモデル群です。このサイトでは、全身制御、器用な操作、具現化推論、オンデバイス動作を組み合わせた、適応性の高いロボットのためのインテリジェンス層として位置付けられています。

この製品ページでは、関連する3つのモデルが紹介されています。Gemini Robotics 2はモーター制御用のvision-language-actionモデル、Gemini Robotics ER 2は高レベルの計画と人間とのコミュニケーション用のvision-languageモデル、Gemini Robotics On-Device 2はロボットハードウェア上でローカルに動作する効率的なVLAモデルです。これらはまとめて、さまざまなエンボディメントをまたいで知覚、推論、実行、連携を必要とするロボットを対象としています。

機能

全身ロボット制御

足先から指先までの全身ヒューマノイドロボットを制御し、視覚と言語を歩行、しゃがみ、手を伸ばす動作、操作のためのモーターアクションに変換します。

器用な操作

5本指ハンドと標準的なグリッパーの両方に高い器用さを与え、繊細な作業や梱包のような作業を含みます。

複数ステップの具現化推論

数分単位で多段階にわたるタスクを推論できるようにし、進捗を追跡しながらVLAモデルと連携して実行します。

複数ロボットの連携

複数のロボットが互いに通信し、仕事を分担して、1台では足りない共有ミッションを完了できるようにします。

オンデバイス適応

ロボティックデバイス上でローカルに動作し、わずか数時間のデータで新しいロボットのエンボディメントにすばやく適応するよう設計されています。

ユースケース

  • 全身を使う家庭内または作業スペースのタスク

    ヒューマノイドロボットが自然言語の指示を受け、目的地まで歩き、必要に応じて曲がったりしゃがんだりして、対象のビンや棚に物体を置きます。

  • 高い器用さを要するタスク

    ロボットが5本指ハンドまたはパラレルグリッパーを使って、結び目を結ぶ、ジップロックを封をする、きつく詰めるといった細かな操作を行います。

  • 複数ステップのタスク実行

    ロボットが長いワークフローを計画し、各ステップが成功したかどうかを追跡し、必要に応じて再試行し、タスク完了まで続けます。

  • 協調ロボットチーム

    複数のロボットが同じ環境で連携し、それぞれの強みを伝え合い、仕事を分担して共有ミッションを完了します。

  • オンデバイス展開

    ローカルなロボット導入が、ネットワーク接続やクラウド遅延に頼らずに、新しいエンボディメントへモデルを適応させます。

Pros and Cons

Pros

  • ヒューマノイド全体を制御し、上半身の動作だけに限定されません。
  • 異なるロボットのエンボディメントにわたって、ハンドとグリッパーの両方をサポートします。
  • ER/VLAの分離されたワークフローで、計画、進捗追跡、アクション実行を組み合わせます。
  • 低遅延またはインターネット接続不要の導入向けに、オンデバイスでローカル実行できます。
  • 数時間分のデータで新しいロボット本体へ適応するよう設計されています。

Cons

  • ソースでは、移動速度にはまだ改善の余地があるとされています。
  • マルチフィンガーの器用な操作は、依然として難しいと説明されています。
  • 記載されているモデルへのアクセスは、Google AI Studio、プライベートプレビュー、早期アクセスパートナーに限定されています。

FAQ

Gemini Robotics ER 2は何に使われますか?

Gemini Robotics ER 2は、具現化推論モデルです。物理世界を理解し、複数ステップのタスクを計画し、人間とコミュニケーションを取り、下位レベルのVLAモデルにモーター実行を引き継ぎます。

Gemini Robotics 2はどのように利用できますか?

ソースによると、Gemini Robotics 2はロボット制御用のvision-language-actionモデルとして提供され、Gemini Robotics ER 2はGoogle AI StudioおよびGemini Enterprise Agent Platformのプライベートプレビューで利用でき、VLAモデルとOn-Deviceモデルは早期アクセスパートナー向けに提供されています。

ERモデルとVLAモデルはどのように連携しますか?

ページでは、ER 2が推論、計画、進捗追跡、連携を担当し、VLAモデルがロボット上でモーター制御を行うワークフローとして説明されています。

オンデバイスモデルには何が追加されますか?

オンデバイスモデルは、ロボティックデバイス上でローカルに動作するよう最適化されており、数時間分のデータで新しいロボットのエンボディメントへ高速に適応できるよう設計されています。

どのような制限が言及されていますか?

ソースでは、全身制御とグリッパーベースの器用なタスクで中程度から高い成功率が示されている一方で、マルチフィンガーの器用な操作は依然として難しいと記されています。

Quick Facts

カテゴリ
ワールドモデルと物理AI
製品ファミリー
Gemini Robotics 2
モデルタイプ
VLA、具現化推論(ER)、およびオンデバイスVLA
アクセス
Google AI Studio、Gemini Enterprise Agent Platformのプライベートプレビュー、早期アクセスパートナー
ソースドメイン
deepmind.google