学術図の生成に、原文との照合と修正を繰り返す処理が組み込まれた。学術図生成AIのPaperVizAgentは、検索から描画、批評までを5種類のエージェントで分担する。GoogleのLLMによる比較評価では、既存の図生成方式を上回った。
論文の技術説明とキャプションを図の入力にする
Googleが開発した学術図生成AIのPaperVizAgentは、論文の文章から図を生成する。入力には、研究の技術的詳細を含む原文と、図で何を伝えたいかを記述した詳細なキャプションを使う。
原文には、通常は論文の手法を説明する部分を与える。キャプションには図が伝えるべき内容を書き込み、技術的な説明と図の目的をそれぞれ入力する。
参考図の検索から描画までを役割ごとに分担する
入力を受け取るのは、検索、計画、スタイル調整、描画、批評を担当する5種類のAIエージェントだ。検索・計画担当が既存の学術図などの参考例を集め、図にする内容を整理する。
整理された内容に対して、スタイル担当が学術的な表現に合わせた見た目の指針を作る。描画担当は画像を描画するほか、統計グラフでは実行可能なPythonコードを生成する。
原文との不整合を描画担当へ戻す
描画した生成物は、批評担当が原文と照合する。不整合が見つかると、具体的な修正内容を描画担当へフィードバックし、生成物の修正を反復させる。
Googleは、この処理で生成した図を、原文への忠実さ、簡潔さ、読みやすさ、見た目の4観点から比較評価した。評価には人が作成した図を使って調整したLLM評価器を用い、0〜100の尺度で人の図の基準値を50.0に設定した。
LLMの比較評価で総合スコア60.2を記録
Googleの評価では、PaperVizAgentの総合スコアは60.2だった。比較対象の画像生成モデルGPT-Image-1.5とNano-Banana-Pro、図生成方式Paper2Anyなどを上回った。
総合スコアで人の図の基準値50.0を超えたのは、評価対象の中でこの図生成AIだけだった。この数値は、人が作成した図を基準に調整したLLM評価器による比較の結果である。