AI

ロボットAI「Gemini Robotics 2」が上半身から全身制御へ

この記事のポイント

  1. 実現したこと

    Google DeepMindは、ロボットAIで5本指・22自由度のハンドを制御し、結び目作りや袋を閉じる動作を示した。

  2. 実現の仕組み

    画像と言語を動作制御へ変換するモデルに、作業手順を考えて進捗を追跡する推論モデルを組み合わせる。

  3. 得られた結果

    機体上で動くモデルは、新しい双腕ロボットへ通常200例未満、数時間で適応できるとGoogle DeepMindはしている。

  4. 従来との違い

    Gemini Robotics 2は、従来モデルの上半身制御から、歩行と物の操作を含む人型ロボットの全身制御へ範囲を広げた。

明るい作業室で、人型ロボットがじょうろを両手で持ち、棚の下段にある緑色の容器へ運んでいる編集イラスト。
AI生成画像

ロボットAI「Gemini Robotics 2」は、人型ロボットの移動と物の操作を全身で制御する。Google DeepMindは、言葉で指定したじょうろを取りに歩き、棚の容器へ置く動作を示した。作業手順を考える推論モデルが、動作制御と進捗の追跡をつなぐ。

画像と言葉から歩行と物の操作へつなぐ

Google DeepMindによると、ロボット用AIモデルGemini Robotics 2は、従来モデルが担っていた人型ロボットの上半身制御から、全身の動作を制御する範囲へ拡張した。画像と言語を動作制御へ変換するVision-Language-Action(VLA)モデルが、移動を含む行動を担う。

実演では、Apptronikの人型ロボットApollo 2が、じょうろを棚の下段にある緑の容器へ入れる指示を受けた。機体はテーブルまで歩いてじょうろを取り、棚まで移動して指定の場所へ置いた。

作業手順の推論が動作と進捗を結ぶ

作業手順を担う推論モデルGemini Robotics ER 2は、利用者の指示と周囲の状況から、完了に必要な手順を考える。動作制御モデルと連携して行動を実行し、作業が終わるまで進捗を追跡する。

Google DeepMindは、この連携によって、数分間にわたり数百回の判断を伴う作業手順を実行し、途中の手順が失敗した場合には自己修正できるとしている。異なる種類のロボットが通信し、共同で作業する機能も導入した。

5本指のハンドと2本指のグリッパーを制御する

全身の移動に加え、物に触れる手先の制御も対象となる。Google DeepMindは、Apollo 2に搭載した5本指・22自由度のロボットハンドSharpaWaveを制御し、結び目を作る動作やジッパー付き袋を閉じる動作を示した。

双腕ロボットFranka Duoでは、2本指の平行グリッパーを使って物を隙間なく詰める作業を示した。Google DeepMindの評価では、全身動作とグリッパーを使う器用な操作は中程度から高い成功率を示した一方、多指ハンドによる器用な操作には課題が残る。

機体上で動くモデルを新しい双腕ロボットへ適応する

機体上での実行を担うGemini Robotics On-Device 2は、ロボット上でローカルに動くよう最適化されたVLAモデルである。Google DeepMindは、新しい双腕ロボットへの適応に必要な時間を数時間、例の数を通常200例未満としている。

適応先には、形状、センサー、自由度が大きく異なる機体も含まれる。Google DeepMindは、ロボットプラットフォームのDexmate、SO101、Trossenで、それぞれ作業を実行する様子を示した。