AIとの共同課題から協働スキルを採点する仕組みが、専門家による評価と同程度の一致度を示した。スキル評価システムVantageは、会話に反論や対立を組み込み、評価に必要な行動を引き出してから、共通の基準で採点する。
反論や対立を組み込んで評価する機会を作る
Googleがニューヨーク大学と共同開発したスキル評価の研究実験Vantageでは、学習者が複数のAIアバターと共同で課題に取り組む。討論の準備や創造的な提案など、自由度のある課題を会話で進める構成だ。
この会話を制御する大規模言語モデルがExecutive LLMである。評価基準と会話の状態を踏まえてアバターの応答を調整し、提案への反論や対立を動的に導入することで、学習者が対象スキルを発揮する機会を作る。英語版はGoogle Labsで利用登録を受け付けている。
対話の制御と採点に同じ基準を使う
課題が終わると、評価用AIのAI Evaluatorが会話記録を受け取る。対話の制御に使ったものと同じ評価基準に照らし、学習者がスキルを発揮した具体的な証拠を評価する。
その評価は、視覚的なスコアと定性的なフィードバックを組み合わせたスキルマップとして学習者に返される。フィードバックの対象は、会話の中で実際に示したスキルである。
独立したAI応答より採点材料が増えた
Googleとニューヨーク大学は、米国の18〜25歳の188人を対象に評価方式を検証した。参加者は、協働スキルのうち対立の解消とプロジェクト管理を評価する課題に取り組んだ。
この共同研究では、同じ課題でアバターが独立して応答する条件と、Executive LLMが対話を制御する条件を比較した。Googleによると、制御する条件では評価対象スキルに関する情報が有意に増え、この傾向は複数の模擬課題で確認された。
専門家との採点一致度を人同士の一致度と比較
集まった会話の採点については、AI Evaluatorとニューヨーク大学の専門家が同じ評価基準を使った。Googleによると、対立の解消とプロジェクト管理で、AIと専門家の一致度は専門家2人の間の一致度と同程度だった。
この比較で測ったのは、評価者間の採点一致度である。一致度の計算には、二次重み付きのCohen’s Kappaという指標を使った。