判断理由への賛同は、実際に誰が作成したかだけでは捉えきれない。人間と大規模言語モデル(LLM)の文章を評価する実験で、参加者がAI作成だと受け取った判断は、実際の生成元にかかわらず賛同されにくかった。
生成元の推測と内容への賛同を別々に測る
研究者のBasile Garcia、Crystal Qian、Stefano Palminteriが実施した一連の実験では、参加者が人間またはLLMによる選択の理由を評価した。対象には、道徳的な選択と非道徳的な選択の両方が含まれる。
参加者は、それぞれの理由を人間とLLMのどちらが作成したか推測し、内容への賛同も回答した。この二つの回答によって、生成元をどう受け取ったかと、判断を受け入れたかを分けて測った。
識別正答率は75%未満、文章の特徴も手掛かりに
生成元の識別正答率は一貫して偶然の水準を上回ったが、75%には届かなかった。参加者は人間とLLMの文章をある程度見分けたものの、識別には誤りも残った。
識別と賛同の両方には、回答の長さ、誤字、一人称代名詞、費用と便益を比較する表現が影響した。生成元の推測に関わる文章上の特徴は、内容を受け入れるかどうかにも関わっていた。
AI作成という受け取り方と低い賛同が結び付く
参加者がAI作成だと受け取った判断への賛同は、実際の生成元にかかわらず低かった。人間が作成した判断も、この傾向の対象に含まれた。
内容の面では、費用と便益を比較する計算に賛同しない傾向が見られた。その種の表現は生成元の識別にも影響しており、文章の特徴、生成元についての認識、内容への評価が関わり合っていた。
実際の生成元で比べると人間への全体的な優先はない
実際に人間が作成した回答が、内容への賛同で全体として好まれたわけではなかった。AI作成だという認識に伴う低い賛同と、実際の生成元別の評価は、異なる結果を示した。
特に難しい道徳的な場面では、LLMが作成した判断理由が好まれた。人間とLLMのどちらの理由が受け入れられるかは、場面によっても異なった。