Science

AI作成だと思われた判断は賛同されにくい

この記事のポイント

  1. 実現したこと

    参加者は判断理由の生成元を偶然より正確に識別したが、正答率は75%未満だった。

  2. 実現の仕組み

    人間とLLMが作成した判断理由について、生成元の推測と内容への賛同をそれぞれ測った。

  3. 得られた結果

    人間作成への全体的な優先はなく、特に難しい道徳的な場面ではLLM作成の判断理由が好まれた。

  4. 従来との違い

    実際の生成元が人間でも、AI作成と受け取られた判断への賛同は低かった。

研究参加者が無地の判断理由カードを読み、生成元の推測用のトークンと内容への賛同を示すスライダーを別々に操作する実験室の編集イラスト。
AI生成画像

判断理由への賛同は、実際に誰が作成したかだけでは捉えきれない。人間と大規模言語モデル(LLM)の文章を評価する実験で、参加者がAI作成だと受け取った判断は、実際の生成元にかかわらず賛同されにくかった。

生成元の推測と内容への賛同を別々に測る

研究者のBasile Garcia、Crystal Qian、Stefano Palminteriが実施した一連の実験では、参加者が人間またはLLMによる選択の理由を評価した。対象には、道徳的な選択と非道徳的な選択の両方が含まれる。

参加者は、それぞれの理由を人間とLLMのどちらが作成したか推測し、内容への賛同も回答した。この二つの回答によって、生成元をどう受け取ったかと、判断を受け入れたかを分けて測った。

識別正答率は75%未満、文章の特徴も手掛かりに

生成元の識別正答率は一貫して偶然の水準を上回ったが、75%には届かなかった。参加者は人間とLLMの文章をある程度見分けたものの、識別には誤りも残った。

識別と賛同の両方には、回答の長さ、誤字、一人称代名詞、費用と便益を比較する表現が影響した。生成元の推測に関わる文章上の特徴は、内容を受け入れるかどうかにも関わっていた。

AI作成という受け取り方と低い賛同が結び付く

参加者がAI作成だと受け取った判断への賛同は、実際の生成元にかかわらず低かった。人間が作成した判断も、この傾向の対象に含まれた。

内容の面では、費用と便益を比較する計算に賛同しない傾向が見られた。その種の表現は生成元の識別にも影響しており、文章の特徴、生成元についての認識、内容への評価が関わり合っていた。

実際の生成元で比べると人間への全体的な優先はない

実際に人間が作成した回答が、内容への賛同で全体として好まれたわけではなかった。AI作成だという認識に伴う低い賛同と、実際の生成元別の評価は、異なる結果を示した。

特に難しい道徳的な場面では、LLMが作成した判断理由が好まれた。人間とLLMのどちらの理由が受け入れられるかは、場面によっても異なった。