利用者の好みが分からない段階での予測も、LLMの学習に役立った。Googleの実験では、ベイズ推論モデルの予測を模倣する追加学習が、常に正解を示す教師を使う場合より推薦精度を改善し、別の課題への汎化も示した。
好みを伏せた利用者へ、5回の推薦を繰り返す
Googleは、大規模言語モデル(LLM)が利用者の選択から好みを推定できるかを、航空便の推薦課題で評価した。模擬利用者とのやり取りは5ラウンドで、各回に3候補を提示し、利用者が選ぶ便と一致する推薦を目指した。
候補を特徴づけるのは、出発時刻、所要時間、乗り継ぎ回数、費用の4項目だ。利用者には各項目について、値の大小への強い好み、弱い好み、または好みなしという設定を与えた。推薦役はその設定を直接参照できず、各回の終了時に推薦の正誤と正解を受け取り、次の推薦へ進んだ。
選択のたびに確率を更新する比較モデル
この選択履歴から好みを推定する比較対象が、ベイズ推論モデルだ。利用者の好みについて複数の可能性を確率分布として保持し、新しい選択を観測するたびにベイズの定理で分布を更新する。更新した分布が、次の推薦の判断に使われる。
Googleの評価では、既存LLMはすべて、この比較モデルより有意に低い成績だった。比較モデルが選択情報の蓄積に応じて推薦を改善した一方、LLMの精度は多くの場合、1回のやり取り後に頭打ちになった。
正解だけでなく、不確実な段階の予測を学習する
Googleは、この差を縮めるため、模擬利用者と推薦役のやり取りを使って教師ありファインチューニングを行った。比較した学習方式の一つ、Oracle teachingでは、利用者の好みを完全に知り、常に正解の便を推薦する教師を使った。
もう一つのBayesian teachingは、ベイズ推論モデルを教師にする方式だ。この教師は利用者の好みを初めから知っているわけではなく、不確実性の大きい序盤には利用者の選択と異なる便を推薦する場合がある。LLMが模倣する対象には、こうした限られた情報からの予測も含まれる。
推薦精度とベイズ推論モデルへの一致が改善
Googleは、学習前のLLMと、二つの方式で追加学習したLLMの推薦精度を、最初と最後のラウンドで比較した。両方式とも成績を有意に改善したが、Bayesian teachingの効果はOracle teachingより一貫して高かった。
改善は推薦の正解率だけに表れたわけではない。ベイズ推論モデルと同じ予測を選んだ試行の割合も高まり、LLMの選択が比較モデルに近づいた。さらに、追加学習に使った推薦課題以外でも改善が確認され、学習した課題を越えた汎化を示した。