推論中の成功と失敗をスキルや洞察として抽出し、後続タスクで使える知識へ更新するテスト時学習が開発された。EvoLibは正解ラベルやモデル更新を使わず、三種類のタスクで既存のメモリ方式を上回った。
推論中の試行からスキルと洞察を抽出
Microsoftが開発したテスト時学習フレームワークのEvoLibは、言語モデルが推論中に得た経験を、後続タスクへ適用できる知識へ変換する。会話や推論過程、行動履歴をそのまま保存するのではなく、次の問題でも使える内容を経験から取り出す構成である。
抽出する知識には、成功した解法から得る再利用可能なスキルと、失敗を振り返って得る洞察がある。EvoLibは両者を知識単位としてライブラリへ収め、新しい経験を処理するときに再利用する。
類似する知識をまとめて適用範囲を広げる
新しいスキルや洞察が抽出されると、EvoLibはライブラリから内容の似た既存知識を検索する。新旧の知識を統合することで、一つの試行だけに結び付いた内容を、複数のタスクへ適用しやすい形に一般化する。
この処理では、経験を追加順に並べたまま残すのではなく、新しい経験と既存知識の共通部分を、より再利用しやすい知識へまとめる。蓄積量だけが増える静的なメモリと異なり、ライブラリに保存された知識の内容そのものが更新される。
将来の知識生成への貢献まで重みに反映
EvoLibは、各知識単位が現在のタスクにどれだけ役立ったかを基に、その重要度を更新する。直接的な有用性が高い知識ほど、ライブラリ内で利用しやすい位置付けになる。
重要度を決める基準には、現在の成果だけでなく、その知識が将来有用な知識の生成へどれだけ貢献したかも含まれる。この動的な重み付けにより、長期的な影響が大きいスキルや洞察がライブラリ内で相対的に重く扱われる。
外部教師とモデル更新を使わず後続タスクへ適用
知識の抽出、統合、重み付けには、正解ラベルや外部フィードバックを必要としない。推論中に生じた経験を入力として知識ライブラリを更新するため、外部の教師信号がなくても経験を次の処理へ引き継げる。
この学習処理は、基盤となるモデルのパラメーター更新からも切り離されている。モデル内部へアクセスできない場合でも、API経由で利用するブラックボックスの言語モデルやAIシステムにEvoLibを組み合わせることができる。
三種類のタスクと異なる提示順で性能を確認
Microsoftは、数学的推論、効率制約付きコード生成、環境を探索しながら進める長期的な操作でEvoLibを評価した。その結果、主要な検索ベースのメモリ方式と他の抽象メモリ方式を一貫して上回り、トークンの使用効率も高かったとしている。
テスト時の計算量を増やす比較では、各タスクを独立に処理する計算量スケーリング手法と、メモリベースの学習手法を比較対象とした。EvoLibは三つのベンチマークで、調べた計算量範囲の大部分において比較手法より高い性能を示し、計算量の増加に伴う改善も速かった。
同じ異種タスク群を異なる順序で与えた評価でも、EvoLibは既存のメモリベース学習方式を一貫して上回った。異なる提示順の間で性能が安定しており、あらかじめ整えたタスク順序に依存せず学習効果を維持した。