AI

失敗も記憶するAIエージェント、Googleの評価で成功率向上

この記事のポイント

  1. 実現したこと

    記憶手法ReasoningBankを組み込んだAIエージェントは、過去の経験から抽出した戦略を次の課題で参照できる。

  2. 実現の仕組み

    実行履歴をLLMで自己評価し、推論手順や判断理由を構造化した記憶として追加する。

  3. 得られた結果

    Googleのソフトウェア修正課題の評価では、記憶を持たない構成より課題当たりの実行ステップが約3ステップ減った。

  4. 従来との違い

    成功した作業手順を記録する比較手法に対し、ReasoningBankは失敗を避ける教訓も記憶へ組み込んだ。

成功と失敗の教訓を記号入りのカードに整理した棚の前で、抽象的なAIエージェントが戦略を参照し、机上のブロックを組み替えてソフトウェア修正を表現するイラスト。
AI生成画像

AIエージェントの記憶手法ReasoningBankは、成功と失敗の経験から次の課題に使える戦略を抽出する。Googleの評価では、記憶を持たない構成よりWeb操作とソフトウェア修正の課題成功率が高まり、修正課題の実行ステップも減った。

行動の記録から、判断理由と失敗の教訓へ

Googleが開発したReasoningBankは、AIエージェントの実行経験を、他の課題にも使える推論戦略へ整理する記憶手法だ。比較対象の記憶手法Synapseが詳細な行動履歴を保存し、Agent Workflow Memoryが成功した試行の作業手順を記録するのに対し、成功と失敗の両方を抽出対象にする。

失敗した経験からは、同じ誤りを避けるための教訓を取り込む。その教訓や戦略を保存する記憶項目は、戦略を示すタイトル、短い説明、推論手順や判断理由などを含む内容の3要素で構成される。

課題の前に記憶を参照し、実行後に知見を追加する

エージェントは行動を始める前に、課題と関連する記憶を取り出してコンテキストへ加える。過去に蓄積した戦略を参照したうえで環境とやり取りし、その実行履歴をLLMで自己評価する。

自己評価からは、成功につながった知見または失敗への省察を抽出する。そこで得た作業手順や一般化可能な知見を新しい記憶として直接追加し、次の課題で取り出せるようにする。

複数の試行と途中の改善も記憶に取り込む

この記憶処理を推論時の計算拡張と組み合わせる手法が、MaTTSだ。並列方式では、記憶を参照しながら同じ課題への異なる実行履歴を複数生成し、それらを比較して戦略を抽出する。

逐次方式では、一つの実行履歴の中で推論を繰り返し改善する。その試行錯誤の途中で得た知見も記憶へ取り込み、最終結果に至るまでの改善過程を再利用の対象にする。

計算拡張を加えない構成でも成功率が向上

Googleの評価は、Web操作のベンチマークWebArenaと、ソフトウェア修正のベンチマークSWE-Bench-Verifiedを対象にした。言語モデルにはGemini-2.5-Flashを使い、全エージェントにReActのプロンプト方式を適用して、記憶を持たない構成、Synapse、Agent Workflow Memory、ReasoningBankを比較した。

この条件では、MaTTSによる計算拡張を加えないReasoningBankでも、両ベンチマークで記憶を持たないエージェントより高い成功率を示した。SWE-Bench-Verifiedでは、課題当たりの実行ステップも記憶を持たない構成より約3ステップ減った。