鳥などの陸上動物の声で学習した音声AIが、クジラの声を含む水中音の分類にも使えることが確認された。生物音響基盤モデルPerch 2.0は水中音を事前学習に含まないが、抽出した特徴表現に少数のラベル付き音声を組み合わせることで、水中音向けの分類器を学習できた。
音声の特徴を取り出し、分類器だけを学習する
Google DeepMindの生物音響基盤モデルPerch 2.0は、主に鳥などの陸上動物の発声で学習されている。Googleは、水中音を事前学習に含まないこのモデルを、水中音の転移学習に用いて評価した。
転移学習では、音声の各時間窓から「埋め込み」と呼ぶ特徴表現を抽出し、それをロジスティック回帰の入力にする。新しい分類器を作る際に学習するのは、この最終段のパラメーターであり、深層ニューラルネットワーク全体のパラメーターを学習し直す必要はない。
クジラの種からシャチの亜集団まで評価
抽出した特徴が水中音の識別にも役立つかを調べるため、評価には音声データセットのNOAA PIPAN、ReefSet、DCLDEを用いた。NOAA PIPANはヒゲクジラ類などのラベル付き録音を含み、ReefSetはサンゴ礁の生物音や波などを含む。
DCLDEでは、分類対象を変えた3種類のラベル集合で評価した。種などを区別する集合に加え、シャチとザトウクジラの確実なラベルに絞った集合、シャチの亜集団を区別する集合を用い、異なる分類の細かさで特徴表現を試した。
クラスごとに4〜32例で分類性能を測る
各データセットの音声からモデルごとに埋め込みを計算し、クラスごとに4、8、16、32例を選ぶ条件で多クラスのロジスティック回帰を学習した。この手順で、少数のラベル付き音声から独自の分類器を作る場合の性能を評価した。
性能指標には、ROC曲線の下面積を表すAUC_ROCを用いた。値が1に近いほどクラスを区別する能力が高いと評価する。NOAA PIPANでは、16例の条件でクラス「Bm」を、32例の条件で「Bm」と「Be」を除外しており、学習例数の条件によって評価対象のクラスも異なる。
4モデルの比較で各条件の首位または2位に
Googleの評価では、Perch 2.0は、旧版の生物音響モデルPerch 1.0、サンゴ礁音声向けモデルSurfPerch、複数種クジラモデルとの比較で、各データセットと学習例数の条件で首位または2位となった。ReefSetでは、複数種クジラモデルを除く比較モデルが、クラスごとに4例の学習でも高い性能を示した。
この分類器作成の手順を利用できるよう、Googleはノートブック実行環境Google Colab向けのチュートリアルも公開した。米国海洋大気庁の環境情報機関NOAA NCEIが提供する受動音響データを使い、Perch 2.0でクジラ音声の独自分類器を作る一連の処理を試すことができる。