AI

入力画像の編集で動画AIの視覚推論が改善

この記事のポイント

  1. 実現したこと

    動画モデルの視覚推論は、課題画像を編集することで改善できる。

  2. 実現の仕組み

    視覚プロンプト調整手法VIPEが、モデルへ与える課題画像を自動的に変更する。

  3. 得られた結果

    Google DeepMindは、文章のプロンプト調整や推論時の計算量増加を上回る効果が得られる場合があるとしている。

  4. 従来との違い

    物理推論の入力例では、抽象的なスケッチ状の場面を写真のような画像へ置き換える。

スケッチ状の球と障害物の課題画像が、同じ場面を保った柔らかな描画へ移り、球が障害物を越えている。
AI生成画像

動画AIへ与える課題画像の見せ方を変えると、視覚推論の性能が改善する。画像を自動編集する手法VIPEは、複数の課題で効果を示した。

課題画像そのものを自動編集する

Google DeepMindが研究した視覚プロンプト調整手法VIPEは、モデルの性能改善を目的に課題画像を自動的に変更する。調整の対象は、モデルへ与える画像そのものだ。

球の着地点を問う場面を写真のように変える

具体例は、障害物を通過した球がどこへ着地するかを問う物理推論課題だ。画像編集モデルを呼び出すことで、抽象的なスケッチ状の場面を写真のような画像へ変換する。

画像の調整が複数の推論課題で効果を示す

Google DeepMindによると、VIPEは複数の課題で動画モデルの推論性能を改善した。改善の対象は、編集画像の見た目ではなく、その画像を使う動画モデルの推論性能である。

文章の調整や推論時の計算量増加と比較する

Google DeepMindは、動画モデルでは視覚プロンプトの調整が従来の文章によるプロンプト調整より効果的になる場合があるとしている。推論時に投入する計算量を増やすtest-time scalingとの比較でも、視覚プロンプトの調整がより効果的になる場合がある。