AI

NVIDIAの動画質問応答AI、追加学習で正答率54.41%から最大93.35%に

この記事のポイント

  1. 実現したこと

    Cosmos 3 Nanoを動画の4択質問応答に追加学習し、未調整時を上回る正答率を得た。

  2. 実現の仕組み

    TAO agent skillsがデータ修正や学習コンテナの実行を支援し、LoRAでReasonerの重みを対象に追加学習する。

  3. 得られた結果

    NVIDIAの実験では、AutoMLによる設定探索後の最高正答率が93.35%に達した。

  4. 従来との違い

    4択問題の完全一致正答率は、追加学習前の54.41%から、LoRAによる1回の学習後に87.14%となった。

抽象的な動画フレームをLoRAアダプター付きReasonerで処理し、4択から回答する流れを示す編集イラスト
AI生成画像

動画質問応答AI「Cosmos 3 Nano」の追加学習で、4択問題の完全一致正答率が未調整時の54.41%から最大93.35%に上がった。NVIDIAは、モデルの一部にLoRAを適用し、学習作業と設定探索をTAO agent skillsで進めた。

動画質問応答の出発点は正答率54.41%

NVIDIAは、マルチモーダルAIモデル「Cosmos 3 Nano」を動画質問応答向けに追加学習した。対象とした4択問題では、追加学習前の完全一致正答率は54.41%だった。この値が、学習後の成績を比べる基準になる。

動画を理解するReasonerだけを学習対象に

Cosmos 3は、マルチモーダルな理解を担うReasonerと、動画や行動を生成するGeneratorを分けている。動画への質問に答える今回の追加学習では、TAO agent skillsが両者を区別し、Reasonerの重みだけを対象にする。

学習方法にはLoRAを使う。LoRAは基盤モデルの重みを固定したまま、学習可能な低ランクの行列を追加するため、全パラメータを書き換える方法とは更新する重みの範囲が異なる。

データ修正から設定探索までをエージェントが支援

TAO agent skillsは、コーディングエージェントがデータの問題を修正し、学習コンテナを実行し、ハイパーパラメータを探索するための手順を提供する。NVIDIAの実験では、この手順とLoRAを組み合わせて動画質問応答モデルを調整した。

同じモデルの全パラメータを更新する教師あり追加学習との比較では、LoRAに必要なGPU時間は約7分の1だった。これはNVIDIAが示した、この追加学習例における計算時間の比較である。

1回の学習で87.14%、設定探索後の最高値は93.35%

NVIDIAの実験では、LoRAによる1回の追加学習で、4択問題の完全一致正答率は87.14%となった。追加学習前の54.41%を上回る結果だ。

さらにTAO AutoMLで学習設定を探索したところ、最高正答率は93.35%に達した。未調整時から最高値までの差は38.94ポイントとなる。