AI

症状を聞き返す対話AI、自由入力のみより診断候補の精度が向上

この記事のポイント

  1. 実現したこと

    実験用の症状評価AIは、参加者との対話から考えられる診断候補と次の行動の推奨を出力した。

  2. 実現の仕組み

    追加質問を行う4方式を、自由に質問する方式と標準的な問診項目を使う方式に分け、利用者主導の入力方式と比較した。

  3. 得られた結果

    追加質問を行う4方式はいずれも、診断候補の正確さで利用者主導の入力方式を有意に上回った。

  4. 従来との違い

    言語モデルの評価対象を、整理済みの詳しい症例記述から、13,917人が自然な対話で申告する症状へ広げた。

参加者がノートPC越しに症状を説明し、追加質問への回答を含む対話記録を臨床医が候補カードとともに確認する研究評価の編集イラスト。
AI生成画像

症状の説明を受けるだけでなく、AIが追加質問を行うことで、診断候補の正確さが改善した。Googleの13,917人を対象とする無作為化研究では、質問を行う4方式すべてが利用者主導の入力方式を有意に上回った。評価対象は研究用の候補一覧で、確定した臨床診断ではない。

自然な症状の申告から診断候補を作る

Googleは、実験用の症状評価AI「SymptomAI」を使い、同意を得た13,917人を5種類の対話エージェントへ無作為に割り当てた。従来の言語モデル評価が主に整理済みの詳しい症例記述を用いていたのに対し、今回は参加者が自然な対話で伝える症状を評価対象にした。

5種類のエージェントはいずれも言語モデルのGemini Flash 2.0を使用し、対話の最後に考えられる診断候補の一覧と次の行動の推奨を出力した。この候補一覧は鑑別診断と呼ばれるが、研究中の出力は分析用であり、確定した臨床診断や正式な医学的評価には当たらない。

追加質問を行う4方式が自由入力を上回る

聞き取り方法の比較では、2方式に自由な追加質問を認め、別の2方式には医学教育で用いられる標準的な問診項目に基づく質問を行わせた。比較対象のbase方式は、利用者が入力を主導する方式とした。

Googleの評価では、AIが追加質問を行う4方式すべてが、診断候補の正確さでbase方式を有意に上回った。質問を自由に組み立てる方式だけでなく、標準的な問診項目を使う方式でも、利用者の入力だけに依存する方式より高い正確さが得られた。

同じ対話記録から作った候補を臨床医が比較

診断候補の品質を比較するため、専門医資格を持つ3人の臨床医も、AIと参加者の対話記録を読んで候補一覧を作成した。各臨床医は、AIと残りの臨床医が作った一覧を、作成元を伏せた状態で順位付けした。

この評価で、臨床医は半数を超えるケースで、他の臨床医の一覧よりAIの一覧を好ましいと判断した。比較したのは同じ対話記録から作った診断候補の品質であり、医療機関での診療全体の優劣を測ったものではない。

受診後の診断が5候補に含まれるかを確認

候補一覧の好ましさとは別に、参加者はAIとの対話から2週間後、医療機関で受けた診断を報告するよう求められた。その報告を用い、医療者による診断が5つの候補に含まれるかを測るTop-5 Accuracyで正確さを評価した。

臨床医は、報告された診断がAIと臨床医それぞれの候補一覧に含まれているかを確認した。Googleの評価では、AIの一覧の方が他の臨床医の一覧より、参加者が報告した医療者による診断を含む頻度が高かった。