医師向け文献検索サービスEvidence Finderに、日本語特化LLMのSakana Namazuが組み込まれた。質問に関連する文献を選ぶ独自アルゴリズムと、文献を比較・統合して回答する言語モデルを接続し、引用文献の実在性を自動検証する機能も備える。
文献の選定から比較・統合へつなぐ
医療AI企業のアイリス株式会社が提供するEvidence Finderは、医師の質問に応じてPubMedなどの文献データベースを検索し、引用元を明示した回答を生成するサービスだ。この回答生成の処理に、Sakana AIが開発する日本語特化LLMのSakana Namazuが採用された。
Sakana AIによると、質問に関連する文献はアイリス独自のアルゴリズムが選ぶ。選ばれた文献を言語モデルが受け取り、内容の比較・統合と回答生成を担う。
引用文献の実在性をVerifyで確認
生成された回答の引用には、文献が実在するかを自動検証するVerify機能が組み合わされる。検証対象は引用文献の実在性であり、Evidence Finderは、医師が回答から一次文献へ速やかに到達できるよう設計されている。
基盤モデルの能力を保ちながら日本語へ適応
回答を担う言語モデルは、オープンモデルのKimi K2.6を基盤とし、Sakana AIの独自データで日本語と日本の業務に合わせて調整されている。Sakana AIの評価では、主要ベンチマーク上で基盤モデルの数学的推論、一般知識・推論、コーディングの性能を維持した。日本語の指示追従、翻訳、日本固有の文脈に関する評価では、基盤モデルを上回ったとしている。
医師国家試験の評価では正解率96.4%
Sakana Namazuを用いたEvidence Finderの評価用モデルは、第120回医師国家試験の評価で正解率96.4%を記録した。これはアイリスが画像問題を除いて実施した試験の結果であり、Sakana AIは、国家試験の成績が臨床現場での有用性をそのまま示すものではないと説明している。
採用の判断には、試験成績に加えて実際の回答に対する定性評価も用いられた。Sakana AIは、その評価で実務上の有用性が認められたことを導入理由として挙げている。