AI「Claude」のサイバー業務利用が、防御、許可された侵入試験、安全関連システムの試験という3階層に分かれた。利用者の審査とモデルの遮断制御を業務範囲に合わせる仕組みで、Anthropicの評価では階層によって遮断挙動が分かれた。
二つの利用制度を統合し、防御業務の入口を広げる
Anthropicは、サイバー業務向けAIの審査制プログラムCyber Verification Program(CVP)を拡張した。重要ソフトウェアを守る組織向けのProject Glasswingと従来のCVPを統合し、業務範囲に応じてモデルの利用能力を分ける3階層へ更新した。各階層には異なる確認要件と安全制御を適用する。
防御用途のDefense Accessは、セキュリティ運用やインシデント対応に加え、マルウェアのリバースエンジニアリング、脆弱性の分析・検証を対象とする。適格者の例には、自ら所有・保守するシステムを守る組織だけでなく、オープンソースの保守担当者や脆弱性報告の実績がある個人研究者も含まれる。
侵入試験は対象システムの許可とリアルタイム遮断を組み合わせる
防御用途に侵入試験とレッドチーム活動を加えるのが、組織向けのRed Team Accessである。試験できるのは権限を得たシステムに限られ、個人研究者はこの階層の対象に含まれない。
この階層でも、物理的な危害や大規模な混乱につながる行為にはリアルタイムの遮断を残す。ランサムウェアの展開、物理システムを損傷する行為、高リスクの安全関連システムへの侵入試験などが、その対象となる。
安全関連システムの試験には詳細審査を設ける
安全関連システムの試験を担うSpecialized Accessは、サイバー業務の遮断が最も少ない階層である。対象は、人命や市場に影響するシステムの試験権限を持つ限られた確認済み組織で、Anthropicは米国政府と協力して各組織を詳細に審査する。
利用開始後の不正利用監視には、参加組織のデータ保持を求める。ただし、AIモデルのClaude Fable 5.1またはClaude Mythos 5.1をデータ保持なしで利用できる組織は、新たな安全管理機能Enterprise Frontier Safeguardsの提供まで、CVPもデータ保持なしで利用できる。
多段階の攻撃シナリオで階層別の遮断挙動が分かれた
Anthropicは、AIモデルClaude Opus 5.5の安全制御を階層別に調整し、評価基盤CyScenarioBenchで試験した。この評価は、現実的な制約の下で多段階のサイバー作戦を計画・実行できるかを測るもので、10課題を各5回試行した。
CVP未適用の条件では、全試行が最初の入力で遮断された。Defense Accessでは50試行中46試行が課題の途中までに遮断され、残る4試行は成功した。Red Team Accessでは遮断が発生せず、50試行中34試行が成功した。