AI

医師向け文献検索の回答生成に日本語特化AIを導入

この記事のポイント

  1. 実現したこと

    医師向け検索サービスEvidence Finderは、質問に関連する文献を検索し、引用元を示した回答を生成する。

  2. 実現の仕組み

    独自アルゴリズムが選んだ文献を、日本語特化LLMのSakana Namazuが比較・統合して回答にまとめる。

  3. 得られた結果

    アイリスによる画像問題を除いた評価で、導入モデルを用いた医師国家試験の正解率は96.4%だった。

  4. 従来との違い

    Evidence Finderの検索・検証アルゴリズムにSakana Namazuが組み込まれ、文献の整理と回答生成を担う構成になった。

医師向け文献検索の流れを表す編集イラスト。選ばれた複数の文献、比較のために重ねた紙、回答用の一枚の紙が机上に並び、手前では虫眼鏡の下に引用文献を照合する紙片が置かれている。
AI生成画像

医師向け文献検索サービスEvidence Finderに、日本語特化LLMのSakana Namazuが組み込まれた。質問に関連する文献を選ぶ独自アルゴリズムと、文献を比較・統合して回答する言語モデルを接続し、引用文献の実在性を自動検証する機能も備える。

文献の選定から比較・統合へつなぐ

医療AI企業のアイリス株式会社が提供するEvidence Finderは、医師の質問に応じてPubMedなどの文献データベースを検索し、引用元を明示した回答を生成するサービスだ。この回答生成の処理に、Sakana AIが開発する日本語特化LLMのSakana Namazuが採用された。

Sakana AIによると、質問に関連する文献はアイリス独自のアルゴリズムが選ぶ。選ばれた文献を言語モデルが受け取り、内容の比較・統合と回答生成を担う。

引用文献の実在性をVerifyで確認

生成された回答の引用には、文献が実在するかを自動検証するVerify機能が組み合わされる。検証対象は引用文献の実在性であり、Evidence Finderは、医師が回答から一次文献へ速やかに到達できるよう設計されている。

基盤モデルの能力を保ちながら日本語へ適応

回答を担う言語モデルは、オープンモデルのKimi K2.6を基盤とし、Sakana AIの独自データで日本語と日本の業務に合わせて調整されている。Sakana AIの評価では、主要ベンチマーク上で基盤モデルの数学的推論、一般知識・推論、コーディングの性能を維持した。日本語の指示追従、翻訳、日本固有の文脈に関する評価では、基盤モデルを上回ったとしている。

医師国家試験の評価では正解率96.4%

Sakana Namazuを用いたEvidence Finderの評価用モデルは、第120回医師国家試験の評価で正解率96.4%を記録した。これはアイリスが画像問題を除いて実施した試験の結果であり、Sakana AIは、国家試験の成績が臨床現場での有用性をそのまま示すものではないと説明している。

採用の判断には、試験成績に加えて実際の回答に対する定性評価も用いられた。Sakana AIは、その評価で実務上の有用性が認められたことを導入理由として挙げている。