攻撃痕跡から検知を生成・検証し、その結果を独立条件の再攻撃へ戻す閉ループ型のサイバー防御が評価された。NVIDIAとCrowdStrikeの試験では、gold判定の3件の検知が未見の8種類の攻撃をカバーした。
隔離環境で攻撃と防御の比較条件を統一
NVIDIAとCrowdStrikeは、攻撃、観測、検知生成、検証、独立した条件による再攻撃を接続したエージェント型の攻撃・防御システムを、隔離した代表環境で評価した。従来のレッドチームとブルーチームの演習に伴う手作業の引き継ぎを、各工程の出力が次の工程へ渡る閉ループに組み替えた構成である。
評価環境は、NVIDIAの高速計算基盤を表す匿名化済みの自然言語仕様から構築され、エンドポイント監視基盤CrowdStrike Falconのセンサーを組み込んだ。NVIDIAのセキュリティ専門家が環境と脅威経路の現実性を確認し、すべての攻撃実行、検知試験、評価指標に同じ環境が使われた。
行動トレースとテレメトリから検知の欠落を特定
攻撃側のハーネスは、脅威情報に基づく目標から攻撃経路を選んで実行し、操作の各段階を行動トレースとして記録した。並行してCrowdStrike Falconのエンドポイントセンサーが対応するテレメトリを取得するため、攻撃側の操作とセンサーが観測したイベントを対応付けられる。
行動トレース、センサーテレメトリ、攻撃コンテキストは防御側のハーネスへ渡された。防御側は、イベント系列のうち再構成できる部分、既存の検知が作動した部分、可視性または検知が欠けた部分を分析し、検知候補を作る対象を定めた。
6つの機構と専門モデルで検知候補を検証
防御側のハーネスは、CrowdStrike Falconのセンサーが対応するスキーマ、フィールド、クエリ構文を列挙できる知識ベースを備える。これにテレメトリによるグラウンディング、専用の検知生成、アーティファクトのlint、検知の再生テスト、独立レビューを加えた6つの機構が、観測データに基づく検証可能な候補を絞り込む。
評価したオープンモデル構成では、大規模言語モデルNVIDIA Nemotron 3 Ultraが防御処理を統括し、追加学習したNVIDIA Nemotron 3 Superが検知の生成と修正を担う範囲限定の専門モデルとして動作した。専門モデルの追加学習には、エージェント訓練基盤NVIDIA NeMo Gymと強化学習基盤NVIDIA NeMo RLを用いた、検証可能な報酬による強化学習が使われた。
検証済み検知を独立条件の再攻撃へ戻す
検証用ハーネスは、生成された検知候補を取得済みテレメトリでバックテストし、失敗した候補を修正工程へ戻した。検証を通過した検知を検知エンジンへ送ることで、候補の生成、試験、修正、配置が一つの処理経路につながる。
検証済みの検知を配置すると、独立したシードによる攻撃が同じ目標を再試験した。そこで得た検知とアラートの情報を攻撃側のハーネスへ戻し、現在の防御を踏まえた別の攻撃経路や回避経路を探索させた。
平均検知率41.9%と未見攻撃への一般化
NVIDIAとCrowdStrikeのバックテストでは、最適化したオープンモデルのパイプラインが6セッションで平均41.9%の検知率を示した。NVIDIA Nemotron 3 Ultraとデフォルトハーネスだけを使った構成と比べると2.5倍だった。
未見の8種類の攻撃を使ったライブファイアテストでは、オープンモデル側の検知の45%が一般化し、比較対象のフロンティアシステム側は29%だった。オープンモデル側でgoldと判定された3件の検知が合わせて8種類すべての攻撃をカバーした一方、フロンティアシステム側にはgold判定の検知がなかった。