AI

原文と照合して修正する学術図生成AI、Googleの評価で既存方式を上回る

この記事のポイント

  1. 実現したこと

    学術図生成AIのPaperVizAgentは、論文の技術的な文章と詳細なキャプションから図を生成する。

  2. 実現の仕組み

    5種類のエージェントが役割を分担し、参考図の検索、内容の整理、見た目の調整を描画につなぐ。

  3. 得られた結果

    GoogleのLLMによる比較評価で、総合スコアは100点尺度で60.2となり、既存の図生成方式を上回った。

  4. 従来との違い

    図を生成する工程に、原文との不整合を検出して描画担当へ戻す反復修正を組み込んだ。

論文ページや参考図と、生成された学術図を重ねて照合し、見つかった差異から描画工程へ戻る修正の流れを描いたイラスト。
AI生成画像

学術図の生成に、原文との照合と修正を繰り返す処理が組み込まれた。学術図生成AIのPaperVizAgentは、検索から描画、批評までを5種類のエージェントで分担する。GoogleのLLMによる比較評価では、既存の図生成方式を上回った。

論文の技術説明とキャプションを図の入力にする

Googleが開発した学術図生成AIのPaperVizAgentは、論文の文章から図を生成する。入力には、研究の技術的詳細を含む原文と、図で何を伝えたいかを記述した詳細なキャプションを使う。

原文には、通常は論文の手法を説明する部分を与える。キャプションには図が伝えるべき内容を書き込み、技術的な説明と図の目的をそれぞれ入力する。

参考図の検索から描画までを役割ごとに分担する

入力を受け取るのは、検索、計画、スタイル調整、描画、批評を担当する5種類のAIエージェントだ。検索・計画担当が既存の学術図などの参考例を集め、図にする内容を整理する。

整理された内容に対して、スタイル担当が学術的な表現に合わせた見た目の指針を作る。描画担当は画像を描画するほか、統計グラフでは実行可能なPythonコードを生成する。

原文との不整合を描画担当へ戻す

描画した生成物は、批評担当が原文と照合する。不整合が見つかると、具体的な修正内容を描画担当へフィードバックし、生成物の修正を反復させる。

Googleは、この処理で生成した図を、原文への忠実さ、簡潔さ、読みやすさ、見た目の4観点から比較評価した。評価には人が作成した図を使って調整したLLM評価器を用い、0〜100の尺度で人の図の基準値を50.0に設定した。

LLMの比較評価で総合スコア60.2を記録

Googleの評価では、PaperVizAgentの総合スコアは60.2だった。比較対象の画像生成モデルGPT-Image-1.5とNano-Banana-Pro、図生成方式Paper2Anyなどを上回った。

総合スコアで人の図の基準値50.0を超えたのは、評価対象の中でこの図生成AIだけだった。この数値は、人が作成した図を基準に調整したLLM評価器による比較の結果である。