AI

知識を持っていても答えられない言語モデル、Googleが測定

この記事のポイント

  1. 実現したこと

    言語モデルの誤答を、事実を符号化できない場合と、符号化した事実を想起できない場合に分けて評価できるようになった。

  2. 実現の仕組み

    答えを明かさない文脈付き課題で事実の再現を測り、表現や質問方向を変えた課題で想起を測る。

  3. 得られた結果

    Gemini-3-ProとGPT-5は、評価対象の事実の95〜98%を符号化していたが、26〜34%を思考なしでは想起できなかった。

  4. 従来との違い

    質問ごとの正誤を集計する評価から、同じ事実への複数の応答を使って5種類の知識状態を区別する評価へ分析単位を変えた。

机上に開かれた図形の資料。左の紙では周囲の手掛かりから欠けた図形が補われ、右の紙では並びを変えた問いに必要な図形が空欄のまま残り、文脈で再現できても質問から想起できない違いを表している。
AI生成画像

大規模言語モデルは、事実を学習していても質問への答えとして取り出せない。Googleの評価では、Gemini-3-ProとGPT-5が符号化していた事実は評価対象の95〜98%に達した一方、26〜34%は思考なしでは想起できなかった。誤答の内訳を、文脈付きの再現と質問への応答から測り分けた。

文脈で再現できる事実と質問で取り出せる事実を分ける

Googleが開発した評価手法Knowledge Profilingは、モデルが事実を内部に表現している状態を「符号化」、その事実を質問への答えとして取り出せる状態を「想起」として区別する。符号化は、答えを明かさず事前学習時に似た文脈を与え、命題の続きを補完したり、文脈付きの質問に答えたりできるかで判定する。内部のパラメータを直接読み取るのではなく、応答から知識状態を評価する手法だ。

その事実を取り出せるかは、意味が等価でも言い回しや関係の方向が異なる質問で確かめる。符号化された事実について、こうした質問に正答できる場合を想起と定義する。質問単位の正誤を事実単位の状態へまとめ、符号化失敗、想起失敗、直接想起、思考を伴う想起、符号化なしの推論の5種類に分類する。

2,150件の事実に10課題ずつを対応させる

この区別を測る評価用データセットWikiProfileは、Wikipediaから抽出した2,150件の事実で構成される。各事実には符号化を調べる2課題、知識を評価する4課題、選択肢から正答を識別する「認識」を調べる4課題を対応させた。同じ事実を異なる答え方で問う構成により、文脈内での再現と質問への応答を照合する。

質問は生成、改良、フィルタリングの順で作成した。検索エンジンに基づく選別で、複数の答えが返る例や追加説明が必要な例を除外し、最後に手作業で検証している。Googleは13種類のモデルを思考あり・なしで評価し、モデル・事実・課題の組み合わせごとに8応答を採取した。約450万応答の採点には言語モデルを使った。

符号化率95〜98%でも直接想起には差が残る

Googleの測定では、Gemini-3-ProとGPT-5が事実を符号化している割合は95〜98%だった。この割合は、評価対象の事実を文脈付き課題で再現できたことを示す。一方、思考なしでは評価対象の26〜34%を直接想起できず、文脈に沿って再現できる範囲と、質問に答えられる範囲に差があった。

思考を有効にした条件でも、評価対象の11〜12%で失敗が残った。思考なしの条件より失敗の割合は低いが、符号化率に近い水準まで正答できたわけではない。いずれの割合も、WikiProfileに含まれる事実と、この研究の課題・判定条件に基づく測定値である。

モデル規模と事実の知名度でも想起の難しさが現れる

同じ評価を言語モデル系列Gemma 3の規模比較に適用すると、大きなモデルほど符号化失敗は減った。想起失敗はなお残り、残存する誤りに占める割合が大きくなった。規模を増やしたモデルでも、事実を再現できるようになることと、質問から取り出せるようになることは同じ程度には進まなかった。

事実の知名度で分けた比較でも、符号化と想起は異なる傾向を示した。知名度が低い事実と高い事実の符号化率の差は比較的小さく、想起の差はそれより大きかった。知名度が低い事実への誤答にも、事実を符号化できていない場合だけでなく、符号化していても取り出しにくい場合が含まれていた。