AI

映像診療AIが模擬試験で専門医水準に、Googleが報告

この記事のポイント

  1. 実現したこと

    研究用医療AIが、患者役とのビデオ診療で身体診察の動作を案内し、リアルタイムに診断推論を行った。

  2. 実現の仕組み

    対話、臨床推論、映像・音声の知覚を3つのエージェントへ分け、非同期で並行処理する。

  3. 得られた結果

    Googleは、100の臨床シナリオに基づく計300件の模擬診療試験で、映像診療AIが専門医水準の性能を示したとしている。

  4. 従来との違い

    文字対話を中心としていたAMIEに、映像・音声を入力するビデオ診療の構成が加わった。

模擬ビデオ診療の場面を描いた編集イラスト。患者役がノートパソコン越しの対話を受けながら片腕を差し出し、机上の簡素な分岐図が診断計画の更新を表している。
AI生成画像

医療AIが、会話に加えて映像・音声の手掛かりを捉え、患者役に身体診察の動作を案内できるようになった。研究用システムAMIEのビデオ診療版は、応答、臨床推論、知覚を並行処理する。Googleは、模擬診療の無作為化試験で専門医水準の性能を示したとしている。

文字対話に映像と音声の観察を加える

Googleが開発する研究用医療AIのAMIE (Video)は、患者役とリアルタイムにビデオ診療を行う。対話中に非言語的な臨床所見を捉え、身体診察の動作を案内しながら診断推論を進める。

この映像診療版は、従来の文字対話に映像・音声を加えた構成である。症状について言葉でやり取りする処理に、会話中の視覚的・聴覚的な手掛かりを扱う処理が加わった。

対話を続けながら診断候補と観察情報を更新する

映像診療版は、3つの専門エージェントを非同期で並行動作させる。患者に応答するTalker agentは、他のエージェントからの助言を取り込みながら、低遅延の音声対話を担う。

その背景では、Planner agentが鑑別診断、つまり症状から考えられる病気の候補と、診療計画を更新する。足りない情報を特定し、臨床上の目標の優先順位も見直す。Perception agentは映像・音声を継続的に確認し、臨床上意味のある非言語的な手掛かりを会話の文脈に位置付ける。

知覚の評価と模擬対話を組み合わせて構成を検証する

開発用の自動評価は、単一ターンの映像・音声評価と、複数ターンの模擬音声診療を組み合わせる。後者では、視覚的な手掛かりを文章として対話へ挿入し、診療のやり取りを評価する。映像を直接扱う評価と、文章化した視覚情報を使う対話評価を組み合わせた構成である。

Googleは、この自動評価で3つのエージェントそれぞれが指標の改善に寄与したとしている。改善対象は臨床能力に加え、対話品質にも及ぶ。

300件の模擬診療で映像版・文字版・医師を比較する

人による評価では、15人の訓練済み患者役が、100の臨床シナリオに基づく計300件の模擬診療を行った。無作為化試験は、映像診療版のAMIE (Video)、文字対話版のAMIE (Text)、専門医資格を持つプライマリケア医10人によるビデオ診療の3群を比較した。

全診療の評価は、診療を担当した医師とは別に、経験豊富なプライマリケア医20人からなる独立した評価パネルが担った。Googleは、この模擬診療試験で映像診療版が専門医水準の性能を示したとしている。