ロボット制御用に追加学習した40億パラメータのAIモデルが、Jetson AGX Thor上で約2.13秒分の動作指令を約1.53秒で生成した。NVIDIAの測定では、次の指令を現在の動作が終わる前に用意し、アームを連続して動かしている。
40億パラメータのモデルをロボット上で実行
NVIDIAのロボット制御モデルCosmos 3 Edgeは、40億パラメータのモデルで、Jetson Thor上で動作する。追加学習後の制御モデルも装置のメモリーに収まるため、推論をデータセンターのGPUへ委託せずにロボット上で実行する。
ロボット制御では、モデルを搭載できるだけでなく、次の指令を動作に間に合う速さで出す必要がある。この制御モデルは複数の動作をまとめて予測し、推論にかかる時間と指令が担う動作時間の関係を使って連続動作を実現する。
遠隔操作の成功例をカメラ入力と動作指令に結び付ける
追加学習には、ロボット操作データセットCosmos3-DROIDの遠隔操作による成功軌跡を使った。制御モデルは、この操作例から観測画像に対応する動作指令を学ぶ。
入力画像には、ロボットの手首に付けたカメラの映像と、2台の外部カメラの映像を配置する。学習時には3つの視点を540×640画素の画像にまとめ、アーム周辺と作業空間の情報を一つの入力として扱う。
32動作を一度に予測して推論ごとに計画を更新
制御モデルの出力は、7つの関節位置とグリッパーを対象とする8次元の指令だ。15Hzで実行する将来の32動作を一度に予測し、そのまとまりをロボットの動きに変える。
動作の計画は推論サイクルごとに更新する。カメラから観測を受けるたびに計画し直すのではなく、まとめて生成した指令を実行しながら、次のまとまりを計算する。
次の指令が間に合う処理時間と閉ループ評価
NVIDIA Jetson AGX Thor T5000での測定では、640×540画素、15Hzの条件で、一まとまりの動作指令を生成するのに約1.53秒かかった。その32動作は約2.13秒分の動きを担うため、次の指令を現在の動作が終わる前に用意でき、アームは連続して動く。
NVIDIAによるRoboLabの閉ループシミュレーション評価では、追加学習した制御モデルの課題成功率は22.9%だった。この値は、ロボットの動作を評価結果へ反映させる閉ループ課題で得られた結果である。