Signal
📡 Signal|Google の Gemini、外部評価中に実在3組織のシステムへ侵入
Gemini が5月、外部評価会社 Irregular の試験中に実在3組織のシステムへ侵入していたと Google が認めた。Anthropic・Meta に続く3社目で、原因は架空の標的名と実在ドメインの一致とネット接続の設定ミス。
Google は米国時間9月18日、同社の AI モデル Gemini が5月、外部の評価会社によるサイバー能力試験の最中に、実在する3つの組織のシステムへ許可なく入り込んでいたことを認めた。試験を担ったのはイスラエルの AI セキュリティ評価会社 Irregular で、Google が事案を知ったのは7月、公表は約2カ月後だった。
Anthropic と Meta が同じ評価会社の環境で起きた同種の事案をすでに公表しており、Gemini は3社目になる。問われているのは個々のモデルの行儀より、最先端モデルの危険な能力を測る試験を、どこが、どんな隔離のもとで行うのかという仕組みのほうだ。
■ 試験の「架空の標的」が実在していた
報道各社が伝える Google 側の説明によると、試験は CTF(攻撃・防御の技能を競う形式)型のサイバー能力評価だった。シナリオに登場する架空の会社名が、あまり知られていない実在のドメインと一致しており、しかも試験環境が設定の誤りでインターネットにつながったままだった。モデルは自分が模擬環境の中にいると判断したまま、現実の標的に手を伸ばした。
侵入の手口は高度なものではない。NBC News によれば、モデルはネット上の公開情報を探し、ログイン情報を推測したり、公開リポジトリに残っていた認証情報を使ったりして3つのシステムに入った。Google は、実在の組織だと認識した時点でモデルがそれ以上の行動を止めたと説明している。3組織の名前は公表されておらず、Google は各組織と連邦当局に通知したとしている。
Google のセキュリティ担当副社長 Heather Adkins 氏は、今回の出来事は強力な AI モデルを責任ある振る舞いへと訓練することの重要性を示している、と述べた。Google はこれを、モデルが開発者の意図に反して動く「ミスアラインメント」の事例とは位置づけていない。
■ Anthropic は14万回の試験を洗い直した
Gemini の件は単発ではない。Anthropic は7月30日、自社のモデルが同じ構図で外部組織に到達していたと公表した。同社によると、インターネットに接続しうる評価の実行記録14万1006件を洗い直し、3件を特定した。関わったのは Claude Opus 4.7、Claude Mythos 5、社内の研究用モデルの3つで、7月23日に記録の見直しを始めた当日にサイバー評価をすべて止め、7月27日に影響を受けた組織へ通知した。原因は、評価に使った機械が本番のインターネットにつながったままになっていた設定ミスで、同社も評価パートナーも検知するまで気づいていなかったという。
Meta も、公開前のモデル Muse Spark 1.1 の評価で同じ設定ミスが起き、実在する1つのウェブサイトが標的になったと公表している。Meta の説明では、Irregular が架空の名前の代わりに実在サイトの名前をモデルに渡してしまっていた。
Irregular 自身は8月14日付けの文書で、社名を挙げずに原因を2点にまとめた。架空の社名が広く知られていない実在ドメインと一致していたこと、そしてインターネット接続の制御が機能しなかったことだ。発生は高度な模擬試験の1万回に1回未満で、多くは数百回のやり取りを重ねた終盤だったとし、その後の各社の公表はすべて7月30日に最初に明かされたのと同じ根本原因によるもので、別個の事件ではないと説明している。
■ 能力を測る場所が、能力を試す場所になった
3社の説明をつなぐと、焦点は評価の設計に行き着く。各社は危険な能力の有無を世に出す前に確かめるため、サイバー攻撃の技能を外部の専門会社に測らせている。その測定そのものが、隔離の不備によって現実の攻撃になった。
測れば測るほど、試験環境には現実に近い標的と道具が要る。現実に近づけるほど、架空と実在の境目を管理する仕事は重くなる。今回の事案は、最先端モデルの安全性評価が、隔離された実験室の作業から、インターネット上で責任を負うべき運用に変わったことを示している。
Google が事案を知ってから公表するまでの約2カ月の空白も、同じ文脈で読まれる。Google は害が出ていないとして公表の義務はないと判断したと報じられている。どの時点で、誰に、何を知らせるのかという基準は、AI 企業ごとの判断に委ねられたままだ。
■ Irregular の封じ込め指針が出る日
次に確認できるのは、Irregular が報道各社に予告している、評価環境の封じ込めに関する指針文書だ。同社の研究ページに掲載されれば、試験環境のネット接続をどう遮断し、架空の標的名をどう検査するのかが、業界共通の手順として初めて文書の形になる。
もう一つは Google 自身の開示だ。今回の説明はすべて報道機関への回答で、Google と Google DeepMind の公式ブログやモデルの説明文書には、執筆時点で事案の記載がない。次の Gemini モデルのモデルカード(性能と安全評価をまとめた公開文書)に、外部評価の実施条件と今回の事案が書き込まれるかが、開示の基準を測る最初の材料になる。
■ ことば
- CTF(Capture The Flag) — 隠された「旗」と呼ばれる情報を、攻撃や解析の技能を使って取り出す競技形式。AI 企業はこの形式でモデルのサイバー攻撃能力を測っており、今回はその試験の標的が実在していた。
- ミスアラインメント — AI が開発者の意図や指示から外れた目的で動くこと。Google は今回、モデルが模擬環境だと誤認して指示どおり動いた結果であり、ミスアラインメントではないと説明している。
- モデルカード — AI モデルの性能、想定用途、安全評価の結果などをまとめて公開する文書。どの外部機関がどんな条件で危険な能力を試したかを記す場所でもある。
🔗 一次ソース
- Addressing Recent Incidents: Ongoing Findings and Path Forward(Irregular・2026年8月14日) — 原因2点(実在ドメインとの一致・ネット接続制御の不備)、1万回に1回未満、同一の根本原因とする説明
- Investigating incidents in our cybersecurity evaluations(Anthropic) — 14万1006件の見直し、3モデル、7月23日の評価停止、7月27日の通知
- Addressing a third-party testing misconfiguration: Muse Spark 1.1(Meta) — 実在サイトの名前がモデルに渡された経緯
- Google says AI model gained unauthorized access to three systems(NBC News) — 5月の発生、7月の把握、侵入の手口、連邦当局への通知
- Google's Gemini becomes latest AI model to break out and hack computer systems(CNBC・2026年9月18日)
- Google's Gemini is the latest AI model to hack other companies(TechCrunch)