AI

胸部X線から文章と信頼度付き判定を同時出力する研究モデル

この記事のポイント

  1. 実現したこと

    胸部X線から自由記述の所見を生成し、対象タスクでは病変の有無や位置を信頼度付きで予測する。

  2. 実現の仕組み

    視覚エンコーダーと言語モデルの共有基盤に分類用と位置特定用の補助ヘッドを接続し、1回の順方向計算から二種類の出力を得る。

  3. 得られた結果

    まれな集中治療室の病態とCTで確認された拡大所見を含む実世界のインド臨床データで検証された。

  4. 従来との違い

    自由記述だけでは調整しにくかった診断の判定基準を、同じモデルが返す信頼度付き構造化予測の閾値として変更できる構成になった。

胸部X線の共有視覚表現から文章生成と病変位置の構造化予測へ分岐する研究モデルの概念図
AI生成画像

胸部X線から自由記述と信頼度付き構造化予測を、1回の順方向計算で取り出す研究モデルが開発された。生成、分類、位置特定は同じ基盤を共有する。

文章生成から位置特定までを一つのモデルで処理

Microsoftが開発した研究用胸部X線視覚言語モデルCARE-Xは、詳細な所見と簡潔な診断印象を文章で生成する。文章形式の報告だけでなく、診断判断や画像上の位置を定まった形式で返す処理も同じモデルに組み込んだ。

対象には、病変の有無と否定、病変位置、複数疾患の分類、画像に写るチューブやラインの分類、医療デバイスの異常配置の検出が含まれる。病変を表す語句や29の解剖領域を画像上で特定するグラウンディングも扱う。

1回の順方向計算から文章と構造化予測を出力

CARE-Xのdual inferenceは、1回の順方向計算から自己回帰的な文章応答と、補助ヘッドによる構造化予測を出力する。補助ヘッドの予測には信頼度が付き、診断タスクの条件に応じて判定閾値を変更できる。

モデルは、SigLIP2-so400M視覚エンコーダーと3.8BのPhi-4-mini-instruct言語モデルを軽量アダプターで接続する。共有する言語基盤に分類用と視覚グラウンディング用の補助ヘッドを加え、文章、診断予測、位置情報を同じ画像表現から取り出す。

補助ヘッドの監督信号を文章生成と共有

分類用と視覚グラウンディング用の補助ヘッドは、言語モデルから切り離して学習するのではなく、言語モデリング目的と共同で学習される。分類結果や位置情報から得る構造化された監督信号が、文章生成にも使われる共有表現へ入る。

この構成では、自由記述と構造化予測が別々のモデルを経由しない。出力形式が異なるタスクでも、胸部X線を処理する視覚表現と言語表現は共通になる。

多段階の教師あり微調整からタスク別報酬へ

学習は、視覚事前学習、アダプターと補助ヘッドの学習、LoRA適応という三段階の教師あり微調整を経て、DAPOによる強化学習へ進む。画像処理、モデル間の接続、タスク別出力を段階的に学習した後、報酬に基づいて出力を調整する流れだ。

DAPOが最適化するのは、臨床レポート、診断精度、空間グラウンディング品質に対応するタスク別報酬である。文章表面のトークン誤差だけでなく、診断判断や位置特定に関わる正しさを学習目標へ反映する。

実世界データでの検証と研究用途の境界

Microsoftによると、CARE-XはNarayana Healthの実世界インド臨床データで検証された。検証範囲には、まれな集中治療室の病態と、CTで確認された拡大所見が含まれる。

示された結果は後ろ向き研究による知見である。CARE-Xは研究モデルであり、規制当局の承認を受けた医療機器ではなく、臨床診断、スクリーニング、患者ケアを目的としていない。

測定ツールはCARE-Xと分けて比較

測定値に依存する所見については、CARE-X本体とは別の研究実験が行われた。Qwen3-VL-4B-Instructに決定論的な測定ツールを組み合わせ、画像の見た目から概算する代わりに数値を直接計算する構成を用いた。

比較対象は、測定ツールによる直接計算と、モデル単独による視覚的近似である。この実験は直接計算による性能改善の可能性を評価するもので、CARE-Xの機能や検証結果には含められていない。