映像を音声で説明するAIに、利用者が知りたい詳細を質問できる試作が登場した。利用者に適応するインターフェースの枠組みNAIでは、文脈を共有するエージェントと、映像・音声・テキストを扱うAIを組み込み、読解や移動、動画視聴を支援する。
文書の文脈を共有して要約と画面調整を分担
Googleが紹介したNatively Adaptive Interfaces(NAI)は、利用者のニーズに適応するアプリケーションを作るための枠組みだ。マルチモーダルAIをインターフェースに組み込み、その具体的な構成を読解支援などの試作で確かめている。
Web読解支援の試作では、中央の調整役となるOrchestratorが文書の文脈を保持し、専門のサブエージェントへ作業を委ねる。要約用エージェントが複雑な文書の情報を分解し、設定用エージェントが文字サイズなどを動的に調整する。
ライブ映像の説明を聞きながら詳細を質問
映像を扱う試作では、AIモデルのGeminiが音声・視覚・テキストを同時に処理する。Googleはこの能力を使い、ライブ映像を即時の対話型音声説明へ変換する試作を構築した。
利用者は、周囲で起きていることのうち知りたい視覚的な詳細を、その場で質問することができる。Googleは共同設計のセッションで、この対話が認知負荷を軽減し得ると観察している。
過去の映像を保持して通り過ぎた場所に答える
視覚障害者やロービジョンの利用者向け移動支援の試作StreetReaderAIは、周囲の分析と質問への応答を二つのAIに分担させる。AI Describerが視覚・地理データを継続的に分析し、AI Chatが利用者の具体的な質問に答える。
この移動支援は文脈を保持し、過去の映像フレームも参照する。Googleが示した動作例では、利用者がバス停を通り過ぎてから場所を尋ねると、以前のフレームを使ってその位置を答える。
動画の説明索引を先に作り、再生中の質問へ回答
動画プレーヤーの試作Multimodal Agent Video Player(MAVP)は、映像の詳細な説明索引をオフラインで生成する。その索引を使い、再生中には検索拡張生成(RAG)で質問へ回答する2段階の処理を採用した。
Geminiを用いたこのプレーヤーでは、利用者が音声で説明の詳しさをリアルタイムに調整したり、再生を止めて登場人物の服装などを質問したりすることができる。Googleは、しばしば固定的な音声解説を聞く従来の視聴に対し、試作で利用者主導の対話を実現したとしている。