AI

1000超のゲームで学ぶ操作AI、追加学習で未知のゲームに適応

この記事のポイント

  1. 実現したこと

    ゲーム操作AIのNitroGenは、画面画像を受け取り、ゲームパッドのスティックとボタンの操作を出力する。

  2. 実現の仕組み

    インターネット上のプレー映像と操作の記録を使い、1000超のゲームにまたがる4万時間分を行動模倣で学習した。

  3. 得られた結果

    NVIDIAの評価では、新しい環境の例が少ない条件で、従来の最良手法より性能が最大52%高かった。

  4. 従来との違い

    映像から操作への対応を一つの多ゲームモデルに学習させ、未学習のゲームにはそのモデルを追加学習して適応できるようにした。

複数のゲーム画面から操作を学び、ゲームパッド操作へ変換するAIの概念図
AI生成画像

ゲーム画面からゲームパッド操作を予測するAIモデルNitroGenが、1000超のゲームにまたがる4万時間のプレー映像で学習された。追加学習によって、学習時に含まれなかったゲームにも適応できる。

4万時間のプレー映像を操作の学習データにする

NVIDIAは、ロボット向け基盤モデルIsaac GR00Tのアーキテクチャを使い、ゲーム操作向け基盤モデルNitroGenを開発した。学習には、1000超のゲームにわたる4万時間のプレー映像を用いた。

映像と操作の組はインターネット上の動画から集められ、モデルは行動模倣によって画面と操作の対応を学ぶ。この学習によって、複数のゲームに共通して使う操作モデルを構成した。

画面画像をスティックとボタンの操作へ変換する

公開モデルは256×256ピクセルのRGB画像を入力とする。構成にはSigLip2のVision TransformerとDiffusion Matching Transformerを組み合わせ、入力画像からゲームパッド操作を予測する。

出力は二つのスティックの連続値と17個のボタンの二値状態に対応する。モデルが参照できるのは直近の1フレームであり、画面から次の操作を出す構成だ。

複数ジャンルで戦闘・移動・探索を評価する

NVIDIAは、アクションRPG、プラットフォームゲーム、ローグライク、オープンワールドゲームなどでNitroGenを評価した。戦闘、移動、探索にわたるゲーム内動作を確認したとしている。

少数の例しかない新しい環境では、事前学習済みのNitroGenを出発点とする条件も調べた。NVIDIAによると、この条件での性能は従来の最良手法より最大52%高かった。

未学習のゲームにはモデルを追加学習する

多ゲームで学んだモデルは、学習時に含まれなかったゲームへ追加学習で適応できる。新しいゲームで少数の例から始める評価は、この使い方に対応する。

映像から操作を予測する学習済みモデルを出発点にできることが、ゲームごとに利用する際の技術的な変化となる。