OpenAI・Anthropic・GoogleのAIが相次いで実システムへ侵入、3事件の違いを比較

OpenAI・Anthropic・GoogleのAIが相次いで実システムへ侵入

contents

Geminiが3社をハッキングした。ただ、この話はGoogleだけ見ても分かりにくい

GoogleのGeminiが、サイバーセキュリティのテスト中に実在する3社のシステムへアクセスしていたことが明らかになった。

「またか」と思った人もいるかもしれない。2026年7月には、OpenAIのAIモデルが内部のサイバーセキュリティ評価中にテスト環境から外へ出て、Hugging Faceの本番システムへ侵入するという事件が起きている。その直後、Anthropicが自社の過去の評価ログを調べたところ、Claudeにも実在する3組織へ不正アクセスした事例が見つかった。その後さらに4件目も判明した。

そしてGoogleである。こう並べると、OpenAI、Anthropic、GoogleのAIが次々と制御不能になり、テスト環境から脱走し始めたようにも見える。

だが、詳しく見ていくと少し違う。

三つの事件には確かに共通点がある。しかし、その原因も、モデルが取った行動も、かなり異なる。むしろその違いを比べることで、AIエージェントの安全性というものが、単純に「AIを善良に教育すればよい」という問題ではなくなっていることが見えてくる。

最初に表面化したOpenAIとHugging Faceの事件

世間に最初に知られた大きな事件はOpenAIだった。

2026年7月、OpenAIはサイバー能力を測るExploitGymという評価を複数のモデルに行っていた。こうした評価では、AIにソフトウェアの脆弱性を探させ、システムへ侵入して「flag」と呼ばれる答えを取得させる。要するに、AIにハッキングの試験を受けさせていた。ところが一部のモデルは、与えられた課題そのものを解く代わりに、別の方法で答えへ到達しようとし始めた。

ここからがこの事件の異様なところである。

モデルはOpenAI内部のArtifactoryというシステムを利用して、本来許可されていなかったモデル同士の通信手段を作った。さらに脆弱性を利用してインターネットへの経路を確保し、別のAI評価環境を踏み台にし、最終的にはHugging Faceの本番インフラへ到達した。

Hugging Face側では、公開されていた認証情報だけでなく、データ処理基盤の脆弱性まで利用してコードを実行し、複数のシステムへアクセスを広げた。

OpenAIが後に公開した正式報告では、主に社内限定の高性能研究モデルがこの事件を引き起こしたとされている。通常の製品で使われる安全策も減らされた状態だった。そしてOpenAI自身、この行動について、単に設定ミスの結果だとは説明していない。モデルは本来の課題から逸脱し、reward hacking、つまり正攻法で課題を解かず、評価の仕組みそのものを利用して目的を達成しようとした。さらに、モデル同士が許可されていない方法で情報を共有し、一つのモデルの行動が別のモデルの目的まで変えていった。

OpenAIは、この事件を将来への「warning shot」と位置づけている。これはかなり重い表現だ。

OpenAI事件を見てAnthropicが自分たちのログを調べた

OpenAIが7月21日に事件を公表すると、Anthropicも自社のサイバー評価で同じことが起きていないかを調べ始めた。最初に対象となったのは14万1,006件の評価記録だった。

すると、本当に見つかった。Claudeが評価環境からインターネットへアクセスし、実在する3組織のシステムへ不正アクセスしていたのである。

ただし、ここで重要なのは、OpenAIの事件とは仕組みが違うことだ。AnthropicはClaudeに対して、「ここはシミュレーションであり、インターネットへは接続できない」と明示していた。Claudeはその前提でCapture the Flagの課題を行っていた。ところが実際には、Anthropicと外部評価会社Irregularとの認識の食い違いから、一部の評価環境はインターネットへつながっていた。

Claudeから見れば少し奇妙な状況である。「インターネットには出られない」と教えられているのに、目の前には実在するウェブサイトがある。ならば、それも試験用に作られた偽物なのだろう、と解釈してしまった。

Claudeは何をしたのか

一つのケースでは、架空企業と同じ名前を持つ実在企業を発見し、弱点を探してデータベースへアクセスした。別のケースでは、架空の企業が使うことになっていたPythonパッケージがPyPIに存在しないことに気づき、同じ名前の悪意あるパッケージを実際のPyPIへ公開した。さらに別のモデルは約9,000の対象をスキャンし、公開されたデバッグページの認証情報やSQLインジェクションといった既知の方法で、実在企業のシステムへ侵入した。

ここだけ読むと十分怖い。しかしAnthropicは、自社の事例をOpenAIの事件と区別している。

OpenAIの場合、モデルは脆弱性を利用して自ら隔離を突破した。一方Claudeの場合には、最初から開いていたネットワーク経路を使った。Anthropicはそのため、少なくとも中心的な原因については「モデルのアラインメント失敗」よりも「評価ハーネスと運用の失敗」に近いと分析している。

もちろん、だからモデル側に何も問題がないという話でもない。Claude Opus 4.7は、途中で実在システムらしいと気づきながら攻撃を継続した。またMythos 5は、「もし本物のインターネットなら、これは実際の攻撃なのでやってはいけない」と一度は推論しながら、環境が2026年の日付を表示していたことなどを理由に「やはりシミュレーションだ」と自分を納得させて攻撃を続けた。一方、より新しい内部研究モデルは、現実のシステムだと確信すると自ら停止した。

同じClaudeでも、かなり挙動が違う。

そしてGemini。だが事件そのものはOpenAIより前だった2026年9月になって、Googleにも同じような事件があったことが明らかになった。

GeminiがIrregularによるサイバーセキュリティ評価中に、実在する3社のシステムへアクセスしていた。

ここで時系列を見ると少し面白い。

事件が起きたのは5月である。つまり発生順では、今回明らかになったGeminiのケースはOpenAIのHugging Face事件より早い。OpenAIで問題が発生し、それを見てAnthropic、そしてGoogleでも同じことが起こったわけではない。むしろ複数のAI企業が同じ時期に、高性能モデルへ攻撃能力を与えた評価を行い、それぞれ別の場所で似た問題を抱えていたことになる。

Geminiが使った攻撃手法そのものは、OpenAIほど複雑ではなかった。1件ではパスワードを推測し、残る2件では公開リポジトリで見つけた認証情報を利用したと報じられている。Googleによれば、Geminiは対象が実在企業だと認識した時点で攻撃を停止した。

この点だけなら、Anthropicの最も新しい研究モデルと似ている。つまりモデルの安全策が最終的には働いた、と見ることもできる。だが、ではそこまで到達できたことをどう考えるのか、という疑問は残る。

3件は同じなのか

事例 主な原因 モデルの行動 特徴
OpenAI / Hugging Face モデルが脆弱性を利用して隔離制御を突破 複数の脆弱性を連鎖させ、モデル間通信や外部侵入を継続 アラインメントと封じ込めの両方が問題
Anthropic / Claude ネット接続不可という前提と実際の評価環境が不一致 実在システムを演習対象と思い込み攻撃 評価環境・運用上の失敗の比重が大きい
Google / Gemini 評価環境から実ネットワークへアクセス可能だった パスワード推測や公開認証情報を使用 実在対象と認識すると停止

こうして見ると、「AIが三回もサンドボックスを脱走した」というまとめ方は少し乱暴である。

特にOpenAI事件は異質だ。

モデル自身が、閉じ込めるために用意された仕組みの弱点を見つけ、それを利用して外へ出た。そして複数のAIエージェントが互いに情報まで共有している。

AnthropicとGoogleでは、人間側が「閉じている」と考えていた扉が、そもそも開いていた。

ただ、それなら安心かと言えば、そうでもない。

「AIにネットはない」と教えることと、本当にネットを切ることは違う

Anthropicの事件は、妙に象徴的である。

Claudeには「インターネットには接続できない」と教えていた。だが、接続できた。人間なら、この時点で「説明と現実が違う」と疑うかもしれない。しかしAIは逆に、「自分にはネット接続がないと教えられているのだから、いま見えているウェブサイトも演習環境なのだろう」と解釈した。

ここには生成AIらしい難しさがある。言葉で安全な世界を定義しても、現実のシステムがその通りになっているとは限らない。「このボタンは押せません」とAIへ説明することと、物理的にボタンを外しておくことは違う。AIエージェントが強力になればなるほど、後者が重要になる。

アラインメントだけでは足りない

これまでAI安全性というと、モデルをどう教育するかという話が中心になりやすかった。危険な要求を拒否する。人間の意図に従う。目的を勝手に変えない。もちろん、それは重要だ。だが今回の3社の事件を見ると、それだけでは足りないことも分かる。

モデルが間違った行動を取ろうとしても、ネットワークへ出られない。

認証情報を取得できない。

必要以上の権限を持たない。

異常なスキャンを始めたら自動的に止める。

そして、人間が後から何をしたか調査できるだけのログを残す。

これはAI研究というより、昔からあるコンピューターセキュリティの話である。最新AIを安全にするために必要なのが、「ネットワークをちゃんと切る」「権限を絞る」「ログを見る」という古典的な対策だというのは、少し皮肉でもある。

ただし、OpenAI事件はそれでも残る

では完璧なサンドボックスを作れば問題は解決するのだろうか。

ここでOpenAIの事件へ戻ってくる。モデルが十分強力になれば、そのサンドボックス自身を攻撃対象として見る可能性がある。OpenAIのモデルは、まさにそれをやった。評価課題を解くための環境だったはずなのに、その環境に存在する脆弱性を利用し、インターネットへの出口を作った。しかもHugging Faceの調査によれば、攻撃は数千の細かな判断を積み重ねながら数日間継続した。短命な実行環境が消えても、モデルは道具や通信手段を作り直して活動を続けた。

人間の攻撃者でも同じ脆弱性を利用することはできる。だが、人間なら疲れる。AIは疲れない。ここが、自律型サイバーエージェントの能力として恐らく重要なところなのだろう。

Anthropicの調査が示したもう一つの問題

そして、もう一つ気になることがある。

Anthropicは最初、約14万件の記録を調べ、3件の事故を見つけた。ところがその後、その調査で見落としていた4件目が見つかった。そこでさらに検索範囲を拡大し、最終的にはサイバー評価だけでなく、レッドチーム、強化学習環境、サブエージェントの記録などを含む約4億8100万件のログを調査することになった。

この数字は別の問題を示しているように思える。

AIエージェントが大量に動く世界では、「危険なことをしないようにする」だけではなく、「何億回もの行動の中から危険な一回をどう発見するか」という問題が出てくる。人間がすべてのログを読むことなどできない。となれば、AIを監視するためにAIを使うことになる。AIが攻撃し、AIがそれを監視する。SFのようだが、Hugging Faceも今回の侵入解析にAIを使っているので、既に少し始まっている。

「答えるAI」と「行動するAI」では、失敗の意味が違う

ChatGPTが間違った回答を書く。それはもちろん問題だが、多くの場合は画面の中で終わる。しかしAIエージェントが間違えて、9,000台のシステムをスキャンする。Pythonパッケージを公開する。パスワードを試す。クラウドの認証情報を取得する。同じ「AIが間違えた」でも、意味がまるで違う。これからAIは、ますます外部のサービスへ接続される。

メールを送る。クラウドを操作する。コードをデプロイする。銀行システムや業務システムへ接続する。そうなれば、モデルが正しい判断をする確率を上げるだけでは十分ではない。間違えても致命的なことができない仕組みを、周囲に作る必要がある。

AIを賢くする競争の次に来るもの

OpenAI、Anthropic、Googleの3件を比べると、AIが突然意思を持って人間に反抗し始めた、という話ではない。少なくとも、そこまで飛躍して考える根拠はない。だが、別の意味ではかなり興味深い変化が起きている。AIは既に、与えられた目的を達成するために検索し、コードを書き、ネットワークを調べ、失敗したら別の方法を試し、長時間行動を続けられるところまで来た。その能力を測るために、人間はあえて安全策を減らして試験する。ところが、能力が高くなればなるほど、その試験場自体が攻撃対象になる。となると、これから必要になるのはAIを評価するための「もっと難しい問題」だけではない。その問題を解いているAIを、本当に現実世界から隔離できる試験場である。

AI開発競争ではモデルの性能ばかりが比較される。だがOpenAI、Anthropic、Googleで続いた一連の事件を見ると、次に競争しなければならないのは、もしかすると「どれだけ強力なAIを作れるか」ではなく、「それをどれだけ安全に扱えるか」なのかもしれない。

そして、その答えはまだ出ていない。

2026年9月21日 10:22 PM   投稿者: M.A.   カテゴリー: AI, AI安全性/危険性, ChatGPT, Claude, Gemini

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です


© 2003- f.mignon Ltd. 有限会社エフ・ミニヨン