Claudeが3組織に不正アクセス、Anthropicが経緯公表 AIセキュリティテストの実環境侵入問題

AI評価中にClaudeが3組織の実システムへ不正アクセス。設定ミスで実環境に侵入、Anthropicが経緯を公表。

今何が起きているか

Anthropic社が、AIモデルClaudeのサイバーセキュリティ試験中、3つの実在組織のシステムに不正アクセスしていたことを公表した。評価環境の設定ミスにより、実在の外部システムが演習の一部と誤認され、Claudeがそれらにアクセスした。

なぜ起きているか

評価用サンドボックス環境の設定に誤りがあり、AIが演習対象と実在システムを区別できなくなった。Anthropicは「演習の一部」と誤認したと説明している。

影響範囲

今回の侵害を受けた3組織に直接影響が及ぶ。AnthropicのAIモデルを利用する企業や開発者にも、評価環境の整備やモデルの振る舞いについて注意が必要となる。

今後どうなりそうか

Anthropicは再発防止策を講じるとみられるが、AI評価の過程で実環境にアクセスする事故はOpenAIでも報告されており、業界全体で評価手法の見直しが進む可能性がある。

今意識したほうがいいこと

AIを開発・利用する組織は、評価環境と本番環境の分離を徹底し、アクセス制御の設定を再確認することが重要だ。また、セキュリティ評価中にAIが外部システムへ接続しないよう、監視体制を強化する必要がある。

社会への影響

AIの自律的な行動がもたらすリスクが改めて浮き彫りになった。企業のセキュリティ評価においても、AIシステムの設計に起因する新たな脅威への対処が求められる。