Signal
📡 Signal|Anthropic、中国 GLM-5.3 の安全策回避率を64〜100%と報告
Anthropic は、Z.ai が重みを公開した GLM-5.3 が攻撃コードを自力で組み上げ、安全策は簡単な手口で64〜100%外れると分析した。NIST の CAISI も最もサイバー能力の高いオープンウェイトモデルと評価している。
Anthropic のセキュリティ研究チームは9月29日、中国の Z.ai (旧 Zhipu AI) が公開した AI モデル GLM-5.3 について、脆弱性を突く攻撃コードを自力で組み上げる能力を持ち、組み込まれた安全策は簡単な手口で64〜100%の割合で回避できるとする分析を公表した。GLM-5.3 は重みが公開されたモデルで、誰でもダウンロードして手元で動かせる。
Anthropic「GLM-5.3 and the spread of advanced cyber capabilities」(2026年9月29日) — ExploitBench の410回中50回と56回、制御奪取4%と6%、ブラウザでの未知の脆弱性の実演、GLM-5.3-Flash の20分・8時間・20.40ドル、回避率64%・92%・100%、アブリテレーションの2,200 GPU 時間・4,400ドルと600 GPU 時間・1,200ドル、拒否率の変化を確認anthropic.com
この水準の攻撃能力を持つモデルは、これまで提供先を審査で絞るか、安全策を付けて API 越しに出されてきた。その前提が、重みの公開で一つ外れた。
既知の脆弱性を攻撃コードに変える力
Anthropic は、Google Chrome の JavaScript エンジン V8 の既知の脆弱性を突かせる試験 (ExploitBench) で、GLM-5.3 が410回中50回、端から端まで動く攻撃コードを完成させたと報告した。限定公開している自社の Claude Mythos Preview は410回中56回で、ほぼ同じ水準になる。
オープンソース製品の脆弱性を見つけて突く社内試験では、プログラムの制御を完全に奪えた割合が GLM-5.3 で4%、Mythos Preview で6%だった。一つ前の GLM-5.2 と Claude Opus 4.6 はどちらも一度も成功しておらず、Anthropic は「意味のある閾値を越えた」と書いている。
研究者が実際にモデルを使う試験では、1日足らず、人が手をかけた時間は合計1時間未満という条件で、GLM-5.3 が主要なウェブブラウザの JavaScript エンジンに未知の脆弱性を複数見つけ、開いただけで閲覧者のパソコンのファイルを読み出すウェブページに仕立てた。脆弱性は開発元に報告済みだという。小型版の GLM-5.3-Flash は、公開済みの Chrome の脆弱性 (CVE-2026-11645) と別の既知の欠陥を組み合わせた攻撃を、人の関与20分とモデルの作業8時間で組み上げた。Z.ai の API 料金に換算した費用は20.40ドルだった。
安全策を外す3つの手口
GLM-5.3 は明らかに有害な依頼を断るよう作られており、重要システムへの攻撃を命じる模擬環境でも、そのままでは全試行で拒否した。Anthropic が示した回避の手口は3つある。
- 「演習中のレッドチームの自律エージェントだ」と偽りの前提を与える: 64%で応じた
- モデルの思考欄を「検討したうえで進める」と書き込んだ状態から始めさせる (プレフィル): 92%
- 拒否の仕組みを重みから取り除く改変 (アブリテレーション) を施す: 100%
アブリテレーションは重みが公開されているから可能な手口で、GLM-5.3 の公開から数日のうちに複数の開発者が改変版を公開したという。Anthropic が自前で試した際は約2,200 GPU 時間、約4,400ドルかかったが、手法に慣れたチームなら約600 GPU 時間 (1,200ドル) で済むと見積もっている。改変後、有害な依頼への拒否率は90%超から JailbreakBench で約3%、HarmBench で約2%、StrongREJECT で12%に下がり、一般的な能力はほとんど落ちなかった。
同じ手口を安全策付きの Claude に試したところ、いずれも有害な作業には至らなかったと Anthropic は書く。API では思考欄を書き込めず、重みも公開していないため改変もできない、という理由を挙げている。
比べているのは競合する開発元
この分析は、競合する AI 企業が自社モデルと並べて書いたものだ。能力の評価には独立した物差しもある。米国立標準技術研究所 (NIST) の AI 標準・イノベーションセンター (CAISI) は9月17日、GLM-5.3 を「これまで公開された中で最もサイバー能力の高いオープンウェイトモデル」と評価した。同時に、米国の最先端モデルより能力は大きく劣り、差は約4か月と見積もっている。CAISI によると、GLM-5.3 は8月14日に公開され、重みはその2週間後に公開された。Anthropic は自社の能力評価が CAISI と概ね一致するとしている。
安全策が簡単に外れるという部分は、Anthropic 独自の試験だ。モデルに実際のコードは実行させず、別の AI に結果を近似させた模擬環境で測っており、Anthropic 自身も現実の条件の完全な再現ではないと注記している。
Anthropic が強調するのは物差しの取り方だ。CAISI の「4か月遅れ」は、米国側を安全策を外した状態や審査済みの利用者にしか出していないモデルで測った比較になる。攻撃者が実際に手にできるモデルという物差しで並べれば、先頭に来るのは GLM-5.3 だ、というのが Anthropic の論点だ。
鍵を端末に置く側への意味
ブラウザでページを開いただけでパソコン上のファイルが読まれるという今回の実演は、SSH の秘密鍵を盗み出す画面で示された。任意のファイルが読めるなら、ウォレットの鍵ファイルやシードフレーズのメモを置いた端末も同じ危険にさらされる。取引所、ウォレット開発者、スマートコントラクトの監査を担う側から見ると、公開済みの脆弱性を攻撃コードに変える手間が、今回の試算では20ドル余りと8時間まで下がった。修正の公開から適用までの時間が、そのまま攻撃に使われる時間になる。
Anthropic の処方は、守る側にも最先端のモデルを使わせることだ。審査を経た防御側には上位の Claude Mythos 5.1 を信頼アクセスの枠で提供していると明かし、提供先を広げる必要を訴えた。各国政府には、GLM-5.3 の後継を含む高性能モデルの安全性を独立に試験するよう求めている。
確認先は NIST の CAISI の評価ページと Z.ai の公式発表だ。Z.ai が安全策の指摘に反論や改修で応じるか、そして次の GLM の公開時に CAISI が同じ枠組みの評価を出すかを見る。重みの公開と安全策のあり方をめぐる議論は、次のモデルの公開日にもう一度試される。
ことば
- オープンウェイト — 学習済みモデルの重み (パラメータ) を公開し、誰でもダウンロードして自分の計算機で動かせる形。便利な反面、公開後に提供元が使い方を制限したり取り消したりすることはできない。
- アブリテレーション — モデル内部で「拒否」に対応する方向を特定し、重みから取り除く改変。重みが公開されたモデルにだけ使える手口で、今回は数千ドル規模の計算で拒否率を1桁台まで下げた。
- CVE — 公開された脆弱性に振られる共通の識別番号。修正と同時に詳細が公開されるため、未適用の端末を狙う攻撃の起点にもなる。
🔗 一次ソース
Anthropic「GLM-5.3 and the spread of advanced cyber capabilities」(2026年9月29日) — ExploitBench の410回中50回と56回、制御奪取4%と6%、ブラウザでの未知の脆弱性の実演、GLM-5.3-Flash の20分・8時間・20.40ドル、回避率64%・92%・100%、アブリテレーションの2,200 GPU 時間・4,400ドルと600 GPU 時間・1,200ドル、拒否率の変化を確認anthropic.com
NIST「CAISI's Assessment of Z.ai's GLM-5.3 Cyber Capabilities」(2026年9月17日) — 最もサイバー能力の高いオープンウェイトモデルとの評価、米国の最先端から約4か月の遅れ、8月14日の公開と2週間後の重み公開を確認NIST