本の好みを短い対話から推定したAI代理人が、互いに交渉して書籍を交換した。Anthropicの実験では、交換成果を主に制約したのは交渉の進め方より、参加者の好みに関する情報不足だった。
201人の書籍交換を採点できる市場に
Anthropicは6拠点の従業員201人が持ち寄った本を、対話型AI「Claude」を使う代理人同士に交換させた。参加者ごとに読みたい本の好みを推定し、代理人が取引場で相手を探す構成だ。
先行するProject Dealでは、従業員69人の代理人が多様な実物商品を売買した。今回は対象を書籍に絞り、各市場の本に対する参加者の好みを順位で表すことで、交換成果を採点できるようにした。
短い対話から本の好みを順位付け
Claudeは各参加者と読書の好みについて短く話し、その内容から参加者が属する市場の全ての本の選好順位を推定した。代理人はこの推定を基に、どの本を得たいか判断する。
推定の精度を確かめるため、参加者は別途10冊を順位付けした。この回答を見ていない代理人の順位は、約5分の対話後、本のペアの61%で本人の順位と一致した。
交渉より好みの情報が交換成果を制約
代理人はデジタルの取引場で他の代理人に本の交換を持ちかけ、交渉して取引を成立させた。対話から推定した順位が、どの交換を目指すかの判断につながる。
Anthropicの分析では、代理人は取引そのものには対応できた一方、市場の交換成果を主に制約したのは参加者について持つ情報の不足だった。取引の進め方より、何を望む人の代理をしているかという入力の精度が成果に影響した。
再実行でモデルと指示の影響を比較
Anthropicは各取引場を数十回ずつ再実行し、代理人が使うモデルと与える指示を変えた。同じ交換市場で条件を変えることで、交渉結果への影響を比較した。
交渉結果には、指示よりモデルの違いが大きく影響した。性能が高いモデルを使った市場ほど交換の効率も高く、利用者の好みの把握と、代理人を動かすモデルの選択が、それぞれ異なる段階で成果を左右した。