動画解析AI基盤VSS 3は、複数種類の特徴量と反復的な検証を組み合わせる検索方式を採用した。用途別に処理を追加できる構成とエージェント用スキルも備え、動画の索引作成から検索までをつなぐ。
動画の特徴を抽出し、検索に渡す
NVIDIAの動画解析AI基盤VSS 3は、モジュール式の構成に、複数の検索手段を組み合わせる機能とエージェント用スキルを加えた。動画処理用マイクロサービスが扱う情報を、視覚言語モデル、大規模言語モデル、検索器と組み合わせ、映像を探す処理につなげる。
複数の埋め込み表現から検索結果を絞る
検索では、動画から複数種類の埋め込み表現を抽出する。埋め込み表現は映像の特徴を検索に使える形で表したもので、VSSは得られた候補を関連性で絞り、意味上の重複を除く。
検索を統括するエージェントは、複雑な質問を小さな質問に分けて処理する。候補が返ると検証を繰り返し、求める対象や出来事に合う結果へ絞り込む。
基本構成に用途別の処理を追加する
VSS 3の開発者向け構成はDocker Composeを基礎とし、基本構成に必要な処理を追加する。用途別には動画検索のほか、警報の検証、リアルタイム警報、長時間動画の要約が用意されている。
NVIDIAは、土台となる基本エージェントを5分未満で導入できるとしている。これは基本構成についての説明であり、用途別の処理をすべて含む導入時間を示す数字ではない。
エージェント用スキルが導入と動画操作をつなぐ
GitHubで公開されたVSSのスキルは、Agent Skills仕様に従う。コーディングエージェントがこのスキルを使うことで、従来は開発者が手作業で設定・導入・連携していた処理を、エージェントとの対話から進められる。
スキルが支援する作業には、VSSの導入、動画のアップロードと索引作成、検索、要約、アプリケーションへの組み込みが含まれる。索引作成で検索可能になった動画を、そのまま検索や要約の処理へ渡せる構成だ。