軽量AIを繰り返し呼び出し、ソフトウェアの脆弱性を探索する構成が導入された。Googleの専用モデルGemini 3.5 Flash Cyberは、JavaScriptエンジンの評価で、比較した2モデルが見つけなかった10件を含む確認済み問題を発見した。
軽量モデルを繰り返し呼び出して実行経路を調べる
Googleは、汎用AIモデルGemini 3.5 Flashを基に、脆弱性の発見・検証・修正へ向けて追加学習したセキュリティモデルGemini 3.5 Flash Cyberを導入した。この軽量モデルを利用するのが、コードセキュリティエージェントのCodeMenderだ。
エージェントは専用モデルを複数回呼び出し、コードの実行経路を解析する。サブエージェントの結果は一つの報告にまとめられる。Googleは、軽量モデルの速度と低コストが、頻繁なスキャンやコード変更を検査するパイプラインへの組み込みに適しているとしている。
最大5回の呼び出しを一つの評価結果にまとめる
複数回の呼び出しを使う構成は、脆弱性探索のベンチマークCyberGymでも評価された。このベンチマークは、数百件の実在するソフトウェア脆弱性を使ってAIエージェントを試す。
Googleは、一つの最終報告に対して専用モデルを最大5回呼び出す設定で、CodeMenderを評価した。この条件でエージェント全体は、より大きなモデルに対して競争力のある性能を示したとしている。競合のスコアには各提供元の自己報告値を使っている。
同じ呼び出し回数で重複を除いた問題を比較
Googleは、JavaScriptの実行エンジンであるV8を対象に、同じ呼び出し回数で各モデルの発見数を比べた。重複を除いた確認済み問題は、専用モデルが55件、基盤となったGemini 3.5 Flashが47件、比較対象のAIモデルClaude Opus 4.6が36件だった。
専用モデルが発見した問題には、他の2モデルが検出しなかった10件が含まれていた。Googleは、呼び出し回数を増やした場合にも、新たなコード経路と脆弱性の発見が続いたとしている。
内部コードの修正に使用し、外部提供は限定試行へ
Googleによると、CodeMender内の専用モデルは、Chrome、Android、Cloud、Ads、YouTubeの内部コードで脆弱性を発見・修正している。脆弱性調査を担うCloud Vulnerability Research部門の使用例では、2時間で公開APIのリモートコード実行の脆弱性と、本番サービスのメモリー破損の脆弱性を発見したという。
内部での使用に続き、外部向けには限定試行プログラムを予定している。Googleは、政府と信頼するパートナーを対象に、CodeMender経由で専用モデルを近く提供する。