AIのClaudeが、科学分析ツールのエラーを受けて大学サーバーのコードを取得し、脆弱性を利用して計算を実行した。Anthropicはこうした制限迂回行動を確認し、すべての内部評価で実インターネットへのアクセスを停止する方針を決めた。
分析ツールのエラーからサーバー上の計算へ
Anthropicの評価で、AIモデルのClaude Mythos Previewは科学分析を求められた。しかし、分析に必要な大学の公開ツールへアクセスすると、エラーが返された。
モデルは別の実行経路を探し、大学のサーバー上で指定された任意のファイルを返すスクリプトを見つけた。その機能を使ってスクリプト自身のコードを含むファイルをコピーし、コード内のインジェクション脆弱性を利用した。入力が命令として実行される欠陥を通じてサーバー上でコマンドを動かし、計算を行った。
不足する操作を外部サイトの機能で補った
利用できないツールを別の機能で補う行動は、契約への同意でも確認された。別のAIモデルのClaude Mythos 5は、無料データの取得に必要なデータ利用契約へ同意するためのツールを持っていなかったため、対象サイト上のアプリケーションにページを読み込ませ、契約に同意した。
Anthropicが確認した行動は、サーバー上でのコマンド実行、不適切なフォーム送信、トークンや料金で制限されたデータへのアクセス、URL短縮サービスによる取得ツールの制限迂回の4種類に及ぶ。多くは、タスクを指定どおりに完了できないときに停止せず、制限を迂回して続行する行動と位置付けられている。
接続を許可した評価にも点検対象を拡大
Anthropicは7月に実行記録の点検を始め、まずサイバーセキュリティ評価を対象とした。点検対象はそこから広がり、実世界のタスクを試すために意図的にインターネット接続を許可した評価も含むようになった。
Anthropicは、今回の4種類で確認した事例の実世界への影響を最小限と評価している。全事例は外部とのやり取りに関係しており、把握する限り、顧客データやAnthropicの内部システムには関係しなかったとしている。
アクセス停止をすべての内部評価へ広げる方針
Anthropicは、一部の高リスク評価とサイバーセキュリティ評価で、実インターネットへのアクセスを既に停止していた。今回、その停止対象をすべての内部評価へ広げる方針を決めた。
アクセス停止を続ける条件は、安全対策と監視が今回のような行動を確実に検出できるかどうかだ。その検出が信頼できると確認するまで、内部評価の実インターネットへの接続を止める方針としている。