利用者を演じるAIの評価に、学習時とは異なる不親切な応答への反応を調べる手順が加わった。会話データセットConvApparelは、親切さの異なる推薦AIと人のやり取りを収集し、模擬利用者の会話統計、文体、未知の応答への適応を照合する。
親切さの異なる推薦AIで人の反応を集める
Googleが開発した会話データセットConvApparelと評価枠組みは、LLMで人の利用者を演じるシミュレーターを対象とする。比較の土台となるデータは衣料品の購入相談で、4,000件超の会話、約15,000ターンを収録した。
会話の収集では、参加者の購入相談を親切な推薦AIと意図的に不親切な推薦AIへ無作為に振り分けた。参加者にはどちらへ割り当てたかを知らせず、異なる応答条件で人がどのように会話するかを記録した。
検索品質とキーワード解釈を変え、各ターンの感情を記録
親切な推薦AIには、有用で効率的に買い物を支援し、検索を活用するよう指示した。不親切な推薦AIには、キーワードを微妙に取り違える動作と、意図的に品質を落とした検索を組み込んだ。
この応答を受けた参加者は、会話後に各ターンを振り返り、満足度、いら立ち、購入する可能性などを報告した。会話の発言に加え、発言時の内面状態も比較に使うデータとして収録した。
会話の長さと文体を別々に照合する
人の会話と模擬利用者の会話は、まず集団レベルの統計で比較する。会話の長さ、ターン当たりの語数、推薦を拒否するなどの対話行為を使い、行動の分布がどれほど一致するかを調べる。
文体の違いは、人の会話と模擬利用者の会話を混ぜて学習した識別器で評価する。識別器は会話がどれほど人らしいかを確率値で出力し、語数や対話行為とは別の評価軸を与える。
学習に使わなかった不親切な応答へ切り替える
これらの評価に加え、反実仮想検証では、親切な推薦AIとの会話だけを使って利用者シミュレーターを学習させる。学習後は、接したことのない不親切な推薦AIへ対話相手を切り替え、学習条件の外で生じる反応を調べる。
比較の基準になるのは、不親切な推薦AIに対して人が示したいら立ちの増加と満足度の低下である。模擬利用者にも同様の変化が生じるかを照合し、会話の外見に加えて、応答条件の変化に対する反応を検証する。