AI

映像の音声説明に質問できるAIインターフェースを試作

この記事のポイント

  1. 実現したこと

    Googleは、ライブ映像を即時の対話型音声説明に変換するAIの試作を構築した。

  2. 実現の仕組み

    読解支援の試作では、中央の調整役が文書の文脈を共有し、要約や画面調整を専門エージェントへ委ねる。

  3. 得られた結果

    Googleは共同設計のセッションで、周囲の視覚的な詳細を質問できることによる認知負荷の軽減を観察した。

  4. 従来との違い

    動画プレーヤーの試作では、固定的な音声解説を聞く視聴から、利用者が説明の詳しさや質問を決める対話型の視聴へ切り替えた。

自然光の入る部屋で、視聴者が一時停止した動画の人物の服装について、ノートPCに向かって音声で質問している編集イラスト。
AI生成画像

映像を音声で説明するAIに、利用者が知りたい詳細を質問できる試作が登場した。利用者に適応するインターフェースの枠組みNAIでは、文脈を共有するエージェントと、映像・音声・テキストを扱うAIを組み込み、読解や移動、動画視聴を支援する。

文書の文脈を共有して要約と画面調整を分担

Googleが紹介したNatively Adaptive Interfaces(NAI)は、利用者のニーズに適応するアプリケーションを作るための枠組みだ。マルチモーダルAIをインターフェースに組み込み、その具体的な構成を読解支援などの試作で確かめている。

Web読解支援の試作では、中央の調整役となるOrchestratorが文書の文脈を保持し、専門のサブエージェントへ作業を委ねる。要約用エージェントが複雑な文書の情報を分解し、設定用エージェントが文字サイズなどを動的に調整する。

ライブ映像の説明を聞きながら詳細を質問

映像を扱う試作では、AIモデルのGeminiが音声・視覚・テキストを同時に処理する。Googleはこの能力を使い、ライブ映像を即時の対話型音声説明へ変換する試作を構築した。

利用者は、周囲で起きていることのうち知りたい視覚的な詳細を、その場で質問することができる。Googleは共同設計のセッションで、この対話が認知負荷を軽減し得ると観察している。

過去の映像を保持して通り過ぎた場所に答える

視覚障害者やロービジョンの利用者向け移動支援の試作StreetReaderAIは、周囲の分析と質問への応答を二つのAIに分担させる。AI Describerが視覚・地理データを継続的に分析し、AI Chatが利用者の具体的な質問に答える。

この移動支援は文脈を保持し、過去の映像フレームも参照する。Googleが示した動作例では、利用者がバス停を通り過ぎてから場所を尋ねると、以前のフレームを使ってその位置を答える。

動画の説明索引を先に作り、再生中の質問へ回答

動画プレーヤーの試作Multimodal Agent Video Player(MAVP)は、映像の詳細な説明索引をオフラインで生成する。その索引を使い、再生中には検索拡張生成(RAG)で質問へ回答する2段階の処理を採用した。

Geminiを用いたこのプレーヤーでは、利用者が音声で説明の詳しさをリアルタイムに調整したり、再生を止めて登場人物の服装などを質問したりすることができる。Googleは、しばしば固定的な音声解説を聞く従来の視聴に対し、試作で利用者主導の対話を実現したとしている。