AI

画像生成AIの本体を固定した補正学習で、人の好みへの適合を改善

この記事のポイント

  1. 実現したこと

    画像生成の補正手法Diffusion Controllerは、基盤モデルを固定したままユーザーの目標に合わせて生成過程を調整する。

  2. 実現の仕組み

    補正ネットワークがノイズ除去の中間情報を受け取り、補助的なアダプター経路を使って生成経路を修正する。

  3. 得られた結果

    Googleの評価では、教師あり学習と報酬重み付き学習で、人の好みを測るHPS-v2勝率がLoRAを上回った。

  4. 従来との違い

    内部の重みを変更するLoRAとの比較で、操作する内部層を減らした構成でも高い評価結果を得た。

ノイズから画像が形になる過程に、別経路の補正が加わる様子を描いた編集イラスト
AI生成画像

画像生成AIの本体を固定し、追加のネットワークで生成途中の経路を補正する手法が、人の好みへの適合を改善した。Googleの評価では、補正手法Diffusion Controllerが二つの学習条件でLoRAより高いHPS-v2勝率を示した。

ノイズ除去全体を一つの制御問題にする

Googleが開発した画像生成の補正手法Diffusion Controllerは、ランダムなノイズから画像を作る過程全体を、連続的な制御問題として扱う。生成途中の経路を調整することで、ユーザーが定めた目標へ画像を近づける。

この制御を担うのは、事前学習済みの基盤モデルに接続する補正ネットワークだ。基盤モデルの重みは固定し、追加したネットワークが生成過程への介入を担う構成にしている。

生成途中の情報を補正ネットワークへ渡す

内部へのアクセスが限定されたgray-box向けの構成では、基盤モデルから中間段階の逆過程の平均値を補正ネットワークへ渡す。補正側はこの入力と補助的なアダプター経路を使い、生成経路を調整する。

比較対象のLoRAは、内部の重みを変更できるwhite-box向けの学習手法だ。Googleは、補正ネットワークを使う構成ではLoRAより少ない内部層への操作で評価結果を得たとしている。

最終画像の報酬から補正を学習する

生成経路の制御を学習へ落とし込む方法には、最終的な報酬スコアを使う方策勾配・PPOと、報酬重み付き損失がある。PPOは小刻みに更新を進め、クリッピング規則によって一度の更新で挙動が大きく変わることを抑える。

報酬重み付き損失は、高い報酬を得た生成過程に大きな重みを与える。その重み付けを通じて、目標に合う画像へ至った生成過程を学習へ反映する。

二つの学習条件でLoRAの勝率を上回る

Googleは画像生成モデルStable Diffusion v1.4を基盤に、教師あり学習、報酬重み付き損失、PPOの三つの条件を評価した。評価には、人の好みに対する生成画像の適合を測るHuman Preference Score(HPS-v2)を使った。

事前学習済みモデルに対するHPS-v2勝率を比較すると、教師あり学習と報酬重み付き損失の条件で、gray-box向けの補正ネットワークがLoRAを上回った。内部の重みを変更できる比較手法に対し、基盤モデルを固定した構成でより高い勝率を示した。