多言語AIの学習では、別の言語のデータが対象言語の性能を助ける場合も、妨げる場合もある。学習則ATLASはこの相互作用を取り込み、データの言語配分とモデル規模を選ぶ指針を示した。Googleは774回の学習実験から、対応言語数を増やす際の拡張則も導いている。
3種類のデータから対象言語への効果を予測する
多言語モデル向け学習則ATLASは、対象言語の性能を最適化するために、モデル規模、学習データ量、言語の混合比を決める指針を提供する。Googleは、1000万〜80億パラメーターのモデルで774回の学習を行い、400超の言語のデータを用いて48言語で評価した。
この学習則は、データを対象言語、実験で学習への貢献が認められた類似言語、それ以外の言語に分ける。3区分のデータがそれぞれ対象言語をどれだけ助けるか、あるいは妨げるかをモデル化する。Googleの評価では、多言語データセットMADLAD-400を使った750回超の実験で、語彙の違いに左右されにくい損失を尺度とした性能予測が先行手法を上回った。
1400組の言語ペアで学習の助け合いを測る
どの言語を一緒に学習させるかを判断するため、Googleは1400組の言語ペアの相互作用を推定した。その結果を行列にまとめ、ある言語の学習データが別の言語の性能を助けるか、妨げるかを表した。
正の学習効果が生じることの最大の予測要因は、文字体系または語族を共有していることだった。この関連はp < .001で統計的に有意だった。一方、学習効果は必ずしも対称ではなく、言語Aが言語Bを助ける程度と、逆方向に助ける程度は異なり得る。
言語数2倍に必要なモデル規模とデータ量を導く
言語間の助け合いとともに考慮する必要があるのが、モデルの容量制約だ。多言語モデルは、容量が限られたまま対応言語を増やすと性能が低下する。Googleはこの現象を、モデル規模と学習データ量に加えて言語数を変数に含む学習則で定式化した。
実験に適合させた学習則は、対応言語数を2倍にして同じ性能を保つための計算効率のよい拡張として、モデル規模を1.18倍、総学習データ量を1.66倍にする指針を導いた。これらの倍率は、言語間の正の学習効果を織り込んだ拡張則によるもので、言語数と同じ比率でモデルやデータを増やす計算にはなっていない。
追加学習とゼロからの学習をトークン数で比較する
モデル規模とデータ量の選択に加え、学習をどこから始めるかも比較した。Googleは10言語について、対象言語でゼロから事前学習する方法と、既存の多言語モデルのチェックポイントから追加学習する方法を評価した。追加学習は学習初期に優位だったが、十分なトークン数を投入するとゼロからの事前学習が上回った。
20億パラメーターのモデルでは、両者の優劣が入れ替わる点は、言語によっておおむね1440億〜2830億トークンの間にあった。既存モデルから始める利点と、長く学習した場合の結果の違いが、投入する学習トークン数に沿って確認された。