ARグラスなどの映像・音声をAIモデルや業務ツールへ接続する共通基盤「NVIDIA XR AI」が、オープンソースの公開ベータとして提供された。機器からの入力を共通のハブで受け、エージェントの処理と利用者への応答をつなぐ。
XR機器とAIサービスを分けて接続する
NVIDIAによると、XR向けエージェント基盤のNVIDIA XR AIは、AIグラス、ARグラス、XRヘッドセット向けのオープンソースライブラリとして公開ベータで提供されている。XR機器は、この基盤を介してクラウド、データセンター、ワークステーション、エッジで動くGPU利用のAIサービスへ接続する。
基盤の内部では、メディア転送、モデルサービス、ツールへのアクセス、エージェントの制御、クライアントへの配信を分けている。NVIDIAは、この分離により、クライアントやモデルなどを交換してもエージェント全体を作り直さずに済むとしている。
カメラとマイクの入力をXR Media Hubで振り分ける
XR機器から届くカメラ映像、マイク音声、データメッセージは、入出力を中継するXR Media Hubに入る。ハブはそれらを、利用者の周囲や意図を扱うモデル、ツール、エージェントへ振り分ける。
映像の画素データは共有メモリに保持でき、システム内では軽量なメタデータを受け渡す。エージェントが画像を必要とする場面でだけ画素データを取得する構成により、映像を毎回ほかの処理へ運ぶ必要を減らす。
映像の把握から言語処理と業務ツールへ
映像を受け取るNVIDIA Cosmosのモデルは、利用者が見ているものに基づく状況把握を担う。NVIDIA Nemotronのモデルは、言葉による要求の理解、推論、ツールの呼び出しを担い、映像と発話をエージェントの処理へつなぐ。
業務用ツールやデータソースは、Model Context Protocol(MCP)サーバーを通じてエージェントに公開される。これにより、エージェントは機器から得た情報と利用者の要求に応じて、接続されたツールを呼び出せる構成になっている。
参加者ごとに応答を返す接続経路
複数のクライアントは同じXR Media Hubに接続できる。応答先は参加者の識別情報で区別され、エージェントの返答は該当する参加者へ送られる。
公開された簡易エージェントの手順では、サービスを起動するとWebクライアントのURLと認証トークンが表示される。利用者はそのクライアントに接続し、マイクを使って質問できる。