同じ学習済み方策を使う2体のヒューマノイドが、ロボット間通信や中央調整なしに相手の動きを読み、掛け布団を共同操作した。Figure AIによると、一連の寝室の片付けは2分未満で完了した。
2体で寝室の片付けを2分未満に収めた実演
ヒューマノイド制御モデル「Helix 02」を開発するFigure AIは、2体のロボットによる寝室の片付けを実演した。ドアを開け、衣類を掛け、ヘッドホンを片付け、本を閉じ、ゴミを捨て、椅子を机の下へ押し込んだ後、2体でベッドを整えるまでを2分未満で実行したとしている。
この作業列では、室内の移動だけでなく、対象に応じた手、足、全身姿勢の使い分けが必要になる。個々の動作を別々に披露するのではなく、家具や物品の配置が変わる一つの室内で連続して処理した。
共有プランナーを置かず相手の動きを視覚で読む
2体は、同じ学習済みVision-Language-Action(VLA)方策をそれぞれ使った。Figure AIによると、両者の行動をまとめる共有プランナー、ロボット間のメッセージ通信、中央コーディネーターはいずれも使っていない。
各ロボットは自身のカメラで室内と相手を観察し、相手の動きから意図を推定する。一方の動作で物体の位置や掛け布団の形が変わると、もう一方は変化した場面を次の判断に使う。
意味的な目標を高速な関節指令へ渡す三層構成
Helix 02は、異なる周期で動くSystem 2、System 1、System 0を階層化している。System 2が場面と言語を処理して意味的な目標を生成し、System 1がその目標と知覚情報から全身の関節目標を200 Hzで出力する。
関節目標を受け取るSystem 0は、接触、バランス、全身の協調を処理し、1 kHzで関節単位のアクチュエーター指令を出す。この構成では、上位層が足運びや姿勢調整を逐一指定せず、意味的な目標を全身動作へ変換する。
System 1への入力は、頭部カメラと手のひらカメラの映像、指先の触覚センサー、全身の自己受容感覚である。出力は脚、胴体、頭部、腕、手首、個々の指までを含む全身の関節目標となる。
人間の運動データから全身のバランス制御を学習
System 0は、1,000万パラメーターの全身制御モデルである。関節レベルにリターゲットした1,000時間を超える人間の運動データを利用し、条件を変化させた20万を超える並列シミュレーション環境で学習された。
従来のHelixでは、System 1が画像と関節状態を入力し、上半身だけを制御していた。Helix 02では入力が全センサーへ広がり、関節目標の出力先も脚、胴体、頭部、腕、手首、指を含む全身へ拡張された。
約4分の食器洗い作業で示した連続全身制御
全身制御を使った別の実演では、1体のHelix 02が食器洗い機から食器を取り出し、室内を移動して棚へ収納した。その後、食器を再び積み込み、食器洗い機を起動するまでの約4分間を連続して処理した。
Figure AIは、この作業が搭載センサーだけを使い、人の介入や途中のリセットなしに自律実行されたとしている。歩行中も食器を保持する必要があるため、移動、把持、姿勢制御が同じ作業列の中で進む。
歩行と片脚バランスを物体操作へつなぐ
寝室の片付けでは、ロボットが室内を歩き、硬い物体、形が変わる布、開閉部を持つ物体、2体で扱う共有物へ順に対応した。Figure AIは、これらのサブタスク間にスクリプト化された引き継ぎを置かなかったとしている。
ゴミ捨てでは、片脚へ体重を移し、反対側の足でごみ箱のペダルを踏みながら手に持ったごみを入れた。椅子の移動では、両手で椅子をつかみ、腕だけでなく足の位置と全身姿勢を使って机の下へ押し込んだ。
形が変わり続ける掛け布団を両側から操作
ベッドメーキングでは、2体がベッドの反対側に位置し、同じ掛け布団へ同時に接触した。一方が布を引けば他方が扱う部分の形や張り方も変わる状況で、互いに干渉せず共同作業を進めた。
2体は掛け布団を持ち上げて広げ、折り、表面を整えた。布が折れたり滑ったりして落ち着くたびに、しわや寄った端を修正しながらベッドメーキングを完了した。