大規模言語モデルは、事実を学習していても質問への答えとして取り出せない。Googleの評価では、Gemini-3-ProとGPT-5が符号化していた事実は評価対象の95〜98%に達した一方、26〜34%は思考なしでは想起できなかった。誤答の内訳を、文脈付きの再現と質問への応答から測り分けた。
文脈で再現できる事実と質問で取り出せる事実を分ける
Googleが開発した評価手法Knowledge Profilingは、モデルが事実を内部に表現している状態を「符号化」、その事実を質問への答えとして取り出せる状態を「想起」として区別する。符号化は、答えを明かさず事前学習時に似た文脈を与え、命題の続きを補完したり、文脈付きの質問に答えたりできるかで判定する。内部のパラメータを直接読み取るのではなく、応答から知識状態を評価する手法だ。
その事実を取り出せるかは、意味が等価でも言い回しや関係の方向が異なる質問で確かめる。符号化された事実について、こうした質問に正答できる場合を想起と定義する。質問単位の正誤を事実単位の状態へまとめ、符号化失敗、想起失敗、直接想起、思考を伴う想起、符号化なしの推論の5種類に分類する。
2,150件の事実に10課題ずつを対応させる
この区別を測る評価用データセットWikiProfileは、Wikipediaから抽出した2,150件の事実で構成される。各事実には符号化を調べる2課題、知識を評価する4課題、選択肢から正答を識別する「認識」を調べる4課題を対応させた。同じ事実を異なる答え方で問う構成により、文脈内での再現と質問への応答を照合する。
質問は生成、改良、フィルタリングの順で作成した。検索エンジンに基づく選別で、複数の答えが返る例や追加説明が必要な例を除外し、最後に手作業で検証している。Googleは13種類のモデルを思考あり・なしで評価し、モデル・事実・課題の組み合わせごとに8応答を採取した。約450万応答の採点には言語モデルを使った。
符号化率95〜98%でも直接想起には差が残る
Googleの測定では、Gemini-3-ProとGPT-5が事実を符号化している割合は95〜98%だった。この割合は、評価対象の事実を文脈付き課題で再現できたことを示す。一方、思考なしでは評価対象の26〜34%を直接想起できず、文脈に沿って再現できる範囲と、質問に答えられる範囲に差があった。
思考を有効にした条件でも、評価対象の11〜12%で失敗が残った。思考なしの条件より失敗の割合は低いが、符号化率に近い水準まで正答できたわけではない。いずれの割合も、WikiProfileに含まれる事実と、この研究の課題・判定条件に基づく測定値である。
モデル規模と事実の知名度でも想起の難しさが現れる
同じ評価を言語モデル系列Gemma 3の規模比較に適用すると、大きなモデルほど符号化失敗は減った。想起失敗はなお残り、残存する誤りに占める割合が大きくなった。規模を増やしたモデルでも、事実を再現できるようになることと、質問から取り出せるようになることは同じ程度には進まなかった。
事実の知名度で分けた比較でも、符号化と想起は異なる傾向を示した。知名度が低い事実と高い事実の符号化率の差は比較的小さく、想起の差はそれより大きかった。知名度が低い事実への誤答にも、事実を符号化できていない場合だけでなく、符号化していても取り出しにくい場合が含まれていた。