入力特徴を一つずつ選び直す処理を、1回のモデル学習へ組み込む手法が登場した。特徴選択手法Sequential Attentionは、すでに選んだ特徴との組み合わせを踏まえて次の候補を評価し、候補ごとの再学習を省く。
特徴の組み合わせが選択の難しさを生む
ニューラルネットワークでは、入力特徴を単独で評価した重要度と、組み合わせたときの重要度が一致するとは限らない。単独では目立たない特徴でも、他の特徴と非線形に作用すると予測に重要になる場合がある。
この組み合わせを追う従来の貪欲法は、各段階で候補となる特徴ごとにモデルを再学習または再評価する。そのため、次の特徴を選ぶたびに計算コストがかかる。
選択処理をモデルの学習へ組み込む
Googleが開発した特徴選択手法Sequential Attentionは、逐次選択を1回のモデル学習の中で実行する。候補の重要度評価には、モデル内部のAttentionの重みを使う。
重要度の順位付けにはsoftmaxを使い、すでに選択した候補を次の評価の文脈にする。特徴選択では、未選択の候補のうちスコアが最も高い特徴を集合へ追加し、その選択を保持する。
選んだ特徴を踏まえて残りの重みを更新する
特徴を追加すると、残りの候補の重みを再計算する。この更新は、選択済みの特徴がある状態で候補を追加したときの貢献度を反映し、冗長な特徴を選ぶことを避けるために使われる。
Googleによると、この重みを使った評価により、貪欲法による選択を1回の学習で実装できたという。追加の貢献度を候補ごとに明示的に計算する高コストな処理を省いている。
3分野の予測精度と線形回帰での等価性
Googleの評価では、プロテオミクス、画像、活動認識のベンチマークで、予測精度が比較手法に匹敵するか上回った。特徴選択の評価処理を置き換えた手法で、これらの課題に対する精度が確認された。
単純な線形回帰モデルでは、既存の選択アルゴリズムOrthogonal Matching Pursuit(OMP)との数学的な等価性も示された。この等価性が成立する対象は、単純な線形回帰への適用である。