AI

誤差逆伝播なしで1000層のニューラルネットワークを学習

この記事のポイント

  1. 実現したこと

    Sakana AIの学習手法PC-ALMは、局所的な動力学だけで1000層のニューラルネットワークを学習した。

  2. 実現の仕組み

    各層にラグランジュ乗数を担うニューロンを加え、PIフィードバック制御で局所的な予測誤差を最小化する。

  3. 得られた結果

    Sakana AIによると、標準的なPredictive Codingでは学習が難しい、深く幅の狭いネットワークでも学習信号を伝えられた。

  4. 従来との違い

    Predictive Codingの学習に使う枠組みを、エネルギーから拡張ラグランジアンへ置き換えた。

各層の局所的な動力学を使い、誤差逆伝播なしに1000層のニューラルネットワークを学習する手法PC-ALMが登場した。予測誤差を抑える各層の動作にラグランジュ乗数を担うニューロンを加え、深いネットワークへ学習信号を伝える。

予測誤差を使う学習は深い層への信号伝達が課題

予測誤差を使う学習の枠組みPredictive Codingは、各ニューロンの活動値を、局所的な予測誤差に基づくエネルギー最小化によって求める。各層を動的に変化する系として扱い、その動作を通じて推論を進める。

Sakana AIが課題として挙げるのは、この枠組みを深いネットワークへ広げた場合の学習信号の伝わり方だ。標準的な方式では、ネットワークの端から内部の層へ信号が伝わりにくく、層を深くしても性能を伸ばしにくい。

エネルギーを拡張ラグランジアンへ置き換える

この信号伝達の課題に対し、Sakana AIの学習手法PC-ALMは、Predictive Codingを分散最適化の考え方で拡張した。局所的な動作を組み立てる枠組みとして、エネルギーの代わりに拡張ラグランジアンを用いる。

追加したニューロンが各層の誤差制御を担う

拡張した枠組みでは、ラグランジュ乗数を担うdual neuronsと呼ばれるニューロンを、各層の局所的な動力学に加える。この追加要素が、標準的なPredictive Codingとの構成上の違いになる。

追加後の各層は、PIフィードバック制御系として働く。制御の対象はその層の局所的な予測誤差であり、各層の動作によって誤差を最小化する。

局所的な動作だけで1000層を学習

Sakana AIによると、この局所的な動力学だけを使う学習手法で、1000層のニューラルネットワークを学習できたという。学習には誤差逆伝播を使わない。

深さに加え、層の幅にも特徴がある。Sakana AIは、標準的なPredictive Codingでは学習が難しい、深く幅の狭いネットワークでも、この手法が学習信号を伝えられるとしている。