AI

ARグラスの映像・音声をAIと業務ツールへつなぐ共通基盤

この記事のポイント

  1. 実現したこと

    ARグラスなどの映像・音声を受け取り、AIモデルと業務ツールを使うエージェントを構築できる。

  2. 実現の仕組み

    カメラ映像やマイク音声をXR Media Hubへ集め、必要なデータをモデルやツールへ振り分ける。

  3. 得られた結果

    公開された簡易エージェントは、起動するとWebクライアントの接続先と認証トークンを表示する。

  4. 従来との違い

    XR向けエージェントの共通基盤が、オープンソースの公開ベータとして利用可能になった。

ARグラスの映像と音声を中央ハブでAIモデルや業務ツールへ振り分け、応答を利用者へ返す流れ
AI生成画像

ARグラスなどの映像・音声をAIモデルや業務ツールへ接続する共通基盤「NVIDIA XR AI」が、オープンソースの公開ベータとして提供された。機器からの入力を共通のハブで受け、エージェントの処理と利用者への応答をつなぐ。

XR機器とAIサービスを分けて接続する

NVIDIAによると、XR向けエージェント基盤のNVIDIA XR AIは、AIグラス、ARグラス、XRヘッドセット向けのオープンソースライブラリとして公開ベータで提供されている。XR機器は、この基盤を介してクラウド、データセンター、ワークステーション、エッジで動くGPU利用のAIサービスへ接続する。

基盤の内部では、メディア転送、モデルサービス、ツールへのアクセス、エージェントの制御、クライアントへの配信を分けている。NVIDIAは、この分離により、クライアントやモデルなどを交換してもエージェント全体を作り直さずに済むとしている。

カメラとマイクの入力をXR Media Hubで振り分ける

XR機器から届くカメラ映像、マイク音声、データメッセージは、入出力を中継するXR Media Hubに入る。ハブはそれらを、利用者の周囲や意図を扱うモデル、ツール、エージェントへ振り分ける。

映像の画素データは共有メモリに保持でき、システム内では軽量なメタデータを受け渡す。エージェントが画像を必要とする場面でだけ画素データを取得する構成により、映像を毎回ほかの処理へ運ぶ必要を減らす。

映像の把握から言語処理と業務ツールへ

映像を受け取るNVIDIA Cosmosのモデルは、利用者が見ているものに基づく状況把握を担う。NVIDIA Nemotronのモデルは、言葉による要求の理解、推論、ツールの呼び出しを担い、映像と発話をエージェントの処理へつなぐ。

業務用ツールやデータソースは、Model Context Protocol(MCP)サーバーを通じてエージェントに公開される。これにより、エージェントは機器から得た情報と利用者の要求に応じて、接続されたツールを呼び出せる構成になっている。

参加者ごとに応答を返す接続経路

複数のクライアントは同じXR Media Hubに接続できる。応答先は参加者の識別情報で区別され、エージェントの返答は該当する参加者へ送られる。

公開された簡易エージェントの手順では、サービスを起動するとWebクライアントのURLと認証トークンが表示される。利用者はそのクライアントに接続し、マイクを使って質問できる。