ロボットAI「Gemini Robotics 2」は、人型ロボットの移動と物の操作を全身で制御する。Google DeepMindは、言葉で指定したじょうろを取りに歩き、棚の容器へ置く動作を示した。作業手順を考える推論モデルが、動作制御と進捗の追跡をつなぐ。
画像と言葉から歩行と物の操作へつなぐ
Google DeepMindによると、ロボット用AIモデルGemini Robotics 2は、従来モデルが担っていた人型ロボットの上半身制御から、全身の動作を制御する範囲へ拡張した。画像と言語を動作制御へ変換するVision-Language-Action(VLA)モデルが、移動を含む行動を担う。
実演では、Apptronikの人型ロボットApollo 2が、じょうろを棚の下段にある緑の容器へ入れる指示を受けた。機体はテーブルまで歩いてじょうろを取り、棚まで移動して指定の場所へ置いた。
作業手順の推論が動作と進捗を結ぶ
作業手順を担う推論モデルGemini Robotics ER 2は、利用者の指示と周囲の状況から、完了に必要な手順を考える。動作制御モデルと連携して行動を実行し、作業が終わるまで進捗を追跡する。
Google DeepMindは、この連携によって、数分間にわたり数百回の判断を伴う作業手順を実行し、途中の手順が失敗した場合には自己修正できるとしている。異なる種類のロボットが通信し、共同で作業する機能も導入した。
5本指のハンドと2本指のグリッパーを制御する
全身の移動に加え、物に触れる手先の制御も対象となる。Google DeepMindは、Apollo 2に搭載した5本指・22自由度のロボットハンドSharpaWaveを制御し、結び目を作る動作やジッパー付き袋を閉じる動作を示した。
双腕ロボットFranka Duoでは、2本指の平行グリッパーを使って物を隙間なく詰める作業を示した。Google DeepMindの評価では、全身動作とグリッパーを使う器用な操作は中程度から高い成功率を示した一方、多指ハンドによる器用な操作には課題が残る。
機体上で動くモデルを新しい双腕ロボットへ適応する
機体上での実行を担うGemini Robotics On-Device 2は、ロボット上でローカルに動くよう最適化されたVLAモデルである。Google DeepMindは、新しい双腕ロボットへの適応に必要な時間を数時間、例の数を通常200例未満としている。
適応先には、形状、センサー、自由度が大きく異なる機体も含まれる。Google DeepMindは、ロボットプラットフォームのDexmate、SO101、Trossenで、それぞれ作業を実行する様子を示した。