動画質問応答AI「Cosmos 3 Nano」の追加学習で、4択問題の完全一致正答率が未調整時の54.41%から最大93.35%に上がった。NVIDIAは、モデルの一部にLoRAを適用し、学習作業と設定探索をTAO agent skillsで進めた。
動画質問応答の出発点は正答率54.41%
NVIDIAは、マルチモーダルAIモデル「Cosmos 3 Nano」を動画質問応答向けに追加学習した。対象とした4択問題では、追加学習前の完全一致正答率は54.41%だった。この値が、学習後の成績を比べる基準になる。
動画を理解するReasonerだけを学習対象に
Cosmos 3は、マルチモーダルな理解を担うReasonerと、動画や行動を生成するGeneratorを分けている。動画への質問に答える今回の追加学習では、TAO agent skillsが両者を区別し、Reasonerの重みだけを対象にする。
学習方法にはLoRAを使う。LoRAは基盤モデルの重みを固定したまま、学習可能な低ランクの行列を追加するため、全パラメータを書き換える方法とは更新する重みの範囲が異なる。
データ修正から設定探索までをエージェントが支援
TAO agent skillsは、コーディングエージェントがデータの問題を修正し、学習コンテナを実行し、ハイパーパラメータを探索するための手順を提供する。NVIDIAの実験では、この手順とLoRAを組み合わせて動画質問応答モデルを調整した。
同じモデルの全パラメータを更新する教師あり追加学習との比較では、LoRAに必要なGPU時間は約7分の1だった。これはNVIDIAが示した、この追加学習例における計算時間の比較である。
1回の学習で87.14%、設定探索後の最高値は93.35%
NVIDIAの実験では、LoRAによる1回の追加学習で、4択問題の完全一致正答率は87.14%となった。追加学習前の54.41%を上回る結果だ。
さらにTAO AutoMLで学習設定を探索したところ、最高正答率は93.35%に達した。未調整時から最高値までの差は38.94ポイントとなる。