各層の局所的な動力学を使い、誤差逆伝播なしに1000層のニューラルネットワークを学習する手法PC-ALMが登場した。予測誤差を抑える各層の動作にラグランジュ乗数を担うニューロンを加え、深いネットワークへ学習信号を伝える。
予測誤差を使う学習は深い層への信号伝達が課題
予測誤差を使う学習の枠組みPredictive Codingは、各ニューロンの活動値を、局所的な予測誤差に基づくエネルギー最小化によって求める。各層を動的に変化する系として扱い、その動作を通じて推論を進める。
Sakana AIが課題として挙げるのは、この枠組みを深いネットワークへ広げた場合の学習信号の伝わり方だ。標準的な方式では、ネットワークの端から内部の層へ信号が伝わりにくく、層を深くしても性能を伸ばしにくい。
エネルギーを拡張ラグランジアンへ置き換える
この信号伝達の課題に対し、Sakana AIの学習手法PC-ALMは、Predictive Codingを分散最適化の考え方で拡張した。局所的な動作を組み立てる枠組みとして、エネルギーの代わりに拡張ラグランジアンを用いる。
追加したニューロンが各層の誤差制御を担う
拡張した枠組みでは、ラグランジュ乗数を担うdual neuronsと呼ばれるニューロンを、各層の局所的な動力学に加える。この追加要素が、標準的なPredictive Codingとの構成上の違いになる。
追加後の各層は、PIフィードバック制御系として働く。制御の対象はその層の局所的な予測誤差であり、各層の動作によって誤差を最小化する。
局所的な動作だけで1000層を学習
Sakana AIによると、この局所的な動力学だけを使う学習手法で、1000層のニューラルネットワークを学習できたという。学習には誤差逆伝播を使わない。
深さに加え、層の幅にも特徴がある。Sakana AIは、標準的なPredictive Codingでは学習が難しい、深く幅の狭いネットワークでも、この手法が学習信号を伝えられるとしている。