AI

利用者を演じるAIを、未学習の不親切な応答で評価する

この記事のポイント

  1. 実現したこと

    利用者を演じるAIが、学習時にない不親切な応答にも人らしく反応するかを検証できるようになった。

  2. 実現の仕組み

    購入相談を親切な推薦AIと不親切な推薦AIへ無作為に振り分け、人の反応を比較用に収集した。

  3. 得られた結果

    衣料品購入を題材に、人とAIの会話4,000件超、約15,000ターンを収録した。

  4. 従来との違い

    会話統計と文体の評価に、親切な応答で学習して不親切な応答で検証する構成を組み込んだ。

衣料品店で、親切な推薦では服を落ち着いて選び、不親切な推薦では合わない服を前に戸惑う利用者を左右に対比した水彩風イラスト。
AI生成画像

利用者を演じるAIの評価に、学習時とは異なる不親切な応答への反応を調べる手順が加わった。会話データセットConvApparelは、親切さの異なる推薦AIと人のやり取りを収集し、模擬利用者の会話統計、文体、未知の応答への適応を照合する。

親切さの異なる推薦AIで人の反応を集める

Googleが開発した会話データセットConvApparelと評価枠組みは、LLMで人の利用者を演じるシミュレーターを対象とする。比較の土台となるデータは衣料品の購入相談で、4,000件超の会話、約15,000ターンを収録した。

会話の収集では、参加者の購入相談を親切な推薦AIと意図的に不親切な推薦AIへ無作為に振り分けた。参加者にはどちらへ割り当てたかを知らせず、異なる応答条件で人がどのように会話するかを記録した。

検索品質とキーワード解釈を変え、各ターンの感情を記録

親切な推薦AIには、有用で効率的に買い物を支援し、検索を活用するよう指示した。不親切な推薦AIには、キーワードを微妙に取り違える動作と、意図的に品質を落とした検索を組み込んだ。

この応答を受けた参加者は、会話後に各ターンを振り返り、満足度、いら立ち、購入する可能性などを報告した。会話の発言に加え、発言時の内面状態も比較に使うデータとして収録した。

会話の長さと文体を別々に照合する

人の会話と模擬利用者の会話は、まず集団レベルの統計で比較する。会話の長さ、ターン当たりの語数、推薦を拒否するなどの対話行為を使い、行動の分布がどれほど一致するかを調べる。

文体の違いは、人の会話と模擬利用者の会話を混ぜて学習した識別器で評価する。識別器は会話がどれほど人らしいかを確率値で出力し、語数や対話行為とは別の評価軸を与える。

学習に使わなかった不親切な応答へ切り替える

これらの評価に加え、反実仮想検証では、親切な推薦AIとの会話だけを使って利用者シミュレーターを学習させる。学習後は、接したことのない不親切な推薦AIへ対話相手を切り替え、学習条件の外で生じる反応を調べる。

比較の基準になるのは、不親切な推薦AIに対して人が示したいら立ちの増加と満足度の低下である。模擬利用者にも同様の変化が生じるかを照合し、会話の外見に加えて、応答条件の変化に対する反応を検証する。