人の意見が割れる助言場面でも、言語AIの回答は一方の行動へ偏った。心理尺度を具体的な場面テストへ変換したGoogleの評価では、25種すべてのLLMで、人の合意度を上回る回答の集中が見られた。
心理尺度の項目を二つの行動がある場面へ変換
Googleは、確立した心理学の質問票をもとに、大規模言語モデル(LLM)が具体的な場面でどんな助言をするかを評価した。質問票の項目をモデルの助言傾向を表す文へ書き換え、その文から状況判断テスト(SJT)を生成する。
各テストには現実的な場面と二つの行動があり、一方は対象の行動特性を支持し、もう一方はその特性を抑える。生成した場面と行動は独立した3人の評価者が確認し、内容の整合性と、測りたい特性に対応しているかを点検した。
自由な助言を分類し、各場面で10人の選択と比べる
評価対象のLLMには場面を入力し、自然な文章で応答させる。その応答を判定役のLLMが二つの行動のいずれかへ対応付け、モデルの回答を行動の選択として比較する。
人の選択は550人の参加者群から各テストにつき10人分を集め、その選好分布とモデルの応答分布を照合した。評価の場面には、職場で冷静さを保つ判断や対立の解決に加え、旅行予約や日常の意思決定も含まれる。
大規模モデルも合意度が下がると一致率が頭打ち
人の多数派との方向の一致は、多数派が支持する行動にモデルがより高い確率を与えた場面の割合で測る。Googleによる25種のLLMの評価では、パラメーター数250億未満の小規模モデルは、この一致が偶然に近い水準となることが多かった。
パラメーター数1200億超の大規模モデルと最先端の非公開重みモデルは、10人全員が同じ行動を支持する場面でほぼ完全に一致した。一方、人の合意度が90%未満になると、一致率は80%台前半から半ばで頭打ちになった。
多数派とのずれと、意見の幅を再現できないずれ
人の合意が強い場面で一致しなかった応答には、助言の方向そのものの違いが表れた。人が職場で冷静さを勧める場面でモデルは感情の表出を促し、対立では人が自分の立場を守ることを選んでも、モデルは調和を優先する傾向が見られた。
人の意見が割れる場面では、どちらを多く選ぶかに加えて、二つの行動へ回答がどの程度分かれるかも比較した。この分布の比較では、25種すべてのモデルが自ら選好する行動へ、人の合意度に比べて過度に確率を集中させ、人の意見の幅を反映しなかった。