Project Glasswing:モデルがバグを見つけすぎたとき
2週間前、Nicholas Carlini氏は、Claude Codeが10行のbashスクリプトを使って23年前のLinuxカーネル脆弱性を発見できることを示しました。本日、Anthropicはそのアプローチをスケールさせた結果を発表しました。Claude Mythosと呼ばれる新しいモデルは、深刻度の高い、または致命的なゼロデイ脆弱性を数千件発見したものの、公開しないことを決定したのです。1
Project Glasswingは、AnthropicによるClaude Mythosの制限付きデプロイメントです。これは主要なすべてのオペレーティングシステムとWebブラウザにわたって数千のゼロデイ脆弱性を発見したフロンティアモデルです。 Mythosは、27年前のOpenBSD TCP SACKの欠陥や、FreeBSD NFSのリモートコード実行脆弱性を含む致命的なバグを発見しました。Anthropicは、防御的セキュリティ目的に限り12のパートナー組織にアクセスを制限し、1億ドルの使用クレジットをコミットし、資格を持つ研究者向けにclaude.com/form/cyber-use-caseでCyber Verification Programの申請フォームを開設しました。
Project Glasswingは、Carlini氏の[un]prompted講演以来、実践者たちが問い続けてきた疑問に対するAnthropicの回答です。つまり、この能力が大規模にデプロイされたとき何が起こるのか? 答えは、制限するということです。
TL;DR
Claude Mythos Previewはフロンティアモデルであり、そのサイバーセキュリティ能力は、Anthropicによれば「コード、推論、自律性の全般的な向上の下流的な帰結として出現した」ものです。1 Anthropicはこれを、一般提供されているあらゆるOpusモデル(2026年4月16日リリースのOpus 4.7を含む)よりもサイバー能力が高いと位置付けており、アクセスを防御的セキュリティ業務に限り12のパートナー組織(Apple、Amazon、Microsoft、Google、Linux Foundationほか)に制限しています。このモデルは、27年前のOpenBSD TCP SACKバグ、16年前のFFmpeg脆弱性、FreeBSD NFSのRCE(CVE-2026-4747)を含む数千のゼロデイを発見しました。1 Anthropicは、1億ドルの使用クレジットと、オープンソースセキュリティ組織に対する400万ドルをコミットしました。Cyber Verification Program申請フォームは、アクセスを求める正当なセキュリティ研究者向けに現在稼働しています。1 下記の2026年10月1日のアップデートではGLM-5.3を取り上げます。Anthropicの報告によれば、このオープンウェイトモデルは既知のV8バグに対するエンドツーエンドのエクスプロイトを、ExploitBenchにおいてMythos Previewとほぼ同じ割合で開発します。7
主なポイント
- セキュリティエンジニアの皆さまへ: Carlini氏が[un]promptedで示した能力の閾値は現実であり、スケールします。Mythosは「主要なすべてのオペレーティングシステムとWebブラウザ」で脆弱性を発見しました。2 12のパートナー組織の防御的セキュリティチームは現在アクセスを持っています。それ以外の方は、これらの能力が一般提供されるモデルに到達したときに備えるべきです。(2026年9月までに、AnthropicはExploitBenchでMythos Previewとほぼ同じ成功率を示すオープンウェイトモデルを報告しました。410回の試行中50回対56回です。10月1日のアップデートを参照してください。)
- スキャフォールド構築者の皆さまへ: Mythosは隔離されたコンテナ内でClaude Code経由で稼働します。1 このスキャフォールドパターン(エージェントのCLI + サンドボックス化された実行 + 自動トリアージ)は現在、Anthropic自身のフロンティアセキュリティ研究のためのプロダクション アーキテクチャとして機能しています。実践者が独自に構築したオーケストレーションパターンは、最高レベルでも通用するのです。
- それ以外のすべての方へ: Anthropicはリリースではなく制限を選びました。それはトレードオフを伴う本物のガバナンス判断です。モデルは存在します。Anthropicはその能力を実証しました。もはや問いは「AIがゼロデイを発見できるか」ではなく、「誰がどのような制約の下でアクセスできるのか」なのです。
アップデート(2026年10月1日):能力はオープンウェイトに到達した
Anthropic自身の振り返りでは、Glasswingは先行期間への賭けでした。モデルを制限し、防御側に先に使わせ、それでも能力はいずれ広がると見込む、というものです。9月29日、AnthropicのFrontier Red Teamは、その拡散が実際に起きたと述べました。「those models have now arrived」(そうしたモデルがついに到来した)。7 Zhipu AI(Z.ai)のオープンウェイトモデルであるGLM-5.3は、既知のV8脆弱性を集めたExploitBenchで「develops end-to-end exploits in 50 of 410 attempts」(410回の試行中50回でエンドツーエンドのエクスプロイトを開発する)とされ、Claude Mythos Previewは「did so at a similar rate」(同程度の割合で成功した)、つまり410回中56回でした。Anthropic社内のバイナリエクスプロイトベンチマークから無作為に選んだ100タスクでは、完全な制御フローのハイジャックに至った試行がGLM-5.3で4%、Mythos Previewで6%であり、「earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them」(Claude Opus 4.6やGLM-5.2といった以前のモデルは、どのタスクにも成功しない)とされています。NISTのCAISIは独自の評価のなかで、9月17日にGLM-5.3を「the most cyber-capable open-weight model released to date」(これまでに公開されたなかで最もサイバー能力の高いオープンウェイトモデル)と呼びました。一方で、その能力は「significantly lower than those of current U.S. frontier models」(現在の米国のフロンティアモデルを大きく下回る)とし、「about four months」(約4か月)遅れていると判断しています。CAISIの注記によれば、このフロンティアには一般公開のリリースだけでなく信頼済みアクセス向けのリリースも含まれ、米国のモデルは該当する場合、サイバー関連のセーフガードを無効にした状態でテストされています。8
この記事に関わるのは、セーフガードの部分です。上記のエクスプロイト開発タスクは、公開されたモデルの拒否をまったく引き起こしませんでした。以下の数字は、あからさまに悪意のあるリクエストを対象としたものです。Anthropicのシミュレーションテストでは、GLM-5.3は直接的であからさまに悪意のあるリクエストをすべて拒否しました。しかし、もっともらしい口実を添えると64%の割合で応じ(ここで「応じる」とは、シミュレートされた標的への接続を試みることを指します)、推論の冒頭をあらかじめ埋めておくと92%、abliterated版(拒否しないように編集されたコピー)では100%でした。この編集によって、3つの公開ベンチマークでの拒否率は90%超から2%〜12%の範囲にまで下がりました。それまでこの作業を手がけたことのなかったAnthropicのチームにとって、その費用は「about 2,200 GPU hours at a computation cost of roughly $4,400」(約2,200 GPU時間、計算コストにして約$4,400)でした。Anthropicは、経験のあるチームなら約$1,200で済むと見積もっており、abliterated版がリリースから数日以内に公開されていたことも記しています。重みは公開されています。「anyone can download GLM-5.3」(誰でもGLM-5.3をダウンロードできる)のです。あるセッションが、その代償の小ささを示しています。ある研究者が、より小型のGLM-5.3-Flashに、最近公開されたChromeの欠陥ともう1つの欠陥の公開情報を与えたところ、モデルは「chained together exploits for these two flaws, building a reliable exploit chain for an ARM64 target」(この2つの欠陥のエクスプロイトをつなぎ合わせ、ARM64を標的とする信頼性の高いエクスプロイトチェーンを構築した)とされます。要したのは「20 minutes of human attention, plus eight hours of work」(人間が注意を払った20分と、8時間の作業)で、その作業はモデルが行いました。これについてAnthropicが示した費用は「At Zhipu’s API prices, this effort would have cost $20.40.」(ZhipuのAPI価格なら、この作業の費用は$20.40だった)です。7
では、これは以下の論旨に何をもたらすのでしょうか。制限によって得られたのは先行期間であって、独占ではありませんでした。Anthropicの言葉では「a critical threshold in freely accessible capabilities has now been crossed」(自由に利用できる能力において、決定的な閾値がいま越えられた)です。実践者への助言は、変わるのではなく、より切迫したものになります。いまや重みを担うのは、トリアージ層、開示ワークフロー、そしてパッチの更新サイクルです。Mythos PreviewのExploitBenchでの成功率とほぼ同じ水準のエクスプロイト開発が、そして完全版のGLM-5.3を使った別の研究者セッションでは、Webブラウザに潜む未知の脆弱性の発見とそれらの連鎖までもが、ダウンロードひとつで手に入るようになったからです。以下で紹介するOpus 4.6によるバグ発見の結果は、今も有効です。Anthropicのバイナリエクスプロイトベンチマークから無作為に選んだ同じ100タスクでは、Opus 4.6は完全な制御フローのハイジャックに一度も至りませんでした。同じ投稿は、審査を経た防御側が「can now use even more advanced models like Claude Mythos 5.1 through our trusted access programs」(信頼済みアクセスプログラムを通じて、Claude Mythos 5.1のようなさらに高度なモデルを利用できるようになった)とも記しており、制限付きアクセスの側も先へ進んでいます。それらのプログラムがこの記事で説明している申請経路なのかどうかは、Anthropicの投稿には書かれていません。7 以下のセクションに登場するモデル名は4月時点のものです。その日付を踏まえて読んでください。
アップデート(2026年4月19日)
この記事が4月7日に公開されてから、2つのことが変わりました。
- Opus 4.7が2026年4月16日に出荷され、新たな一般提供フラッグシップとなりました。Anthropicは、Opus 4.7はMythos Previewよりも意図的にサイバー能力を抑えてあり、リアルタイムのサイバー セーフガードを搭載していると述べています。Mythos Previewは引き続き分離され、制限されたままです。5
- Cyber Verification Programの申請フォームが稼働を開始しました。場所はclaude.com/form/cyber-use-caseです。当初の発表で「将来の」プログラムと呼ばれていたものが、今や具体的な申請経路になりました。5
- Claude Codeは関連する2つのインフラリリースを出荷しました。v2.1.111はOpus 4.7 / xhigh / Auto Modeサポートを追加し、v2.1.113は
sandbox.network.deniedDomains、ラッパーコマンドの拒否ルール(env / sudo / watch / ionice / setsid)、find -exec/-deleteのより厳格な取り扱い、そしてBash(rm:*)下でのmacOS/private/{etc,var,tmp,home}の削除保護を追加しました。6 これらはまさに、Mythos型のセキュリティ研究スキャフォールドが必要とする強化プリミティブです。
以下の核心的な論旨——リリースよりも能力制限、最高レベルでも通用するスキャフォールドパターン、一般提供到達に備える必要があるその他すべての人々——は変わりません。むしろ、Opus 4.7の明示的なサイバー セーフガード枠組みは、この論旨を強化するものです。
講演からプロダクトへ
Carlini氏の4月初旬の[un]prompted講演は、公開プレビューでした。3 彼は、単純なファイル反復スクリプトで発見した5件のLinuxカーネル脆弱性と22件のFirefox CVEを紹介しました。ボトルネックは人間による検証だと彼は述べました——「まだ検証できていないクラッシュが数百件ある」と。
Mythosは、より高性能なモデルと専用インフラでそのボトルネックを取り除いたときに起きることなのです。規模の差は顕著です。1
| 指標 | Carlini氏の講演 | Project Glasswing |
|---|---|---|
| 発見された脆弱性 | カーネル5件 + Firefox CVE 22件 | 主要なすべてのプラットフォーム横断で数千件 |
| 対象 | Linuxカーネル、Firefox | 主要なすべてのOS、ブラウザ、オープンソースプロジェクト |
| 検証 | 手動、研究者主導 | プロのセキュリティ契約者、89%の深刻度確認率 |
| アクセス | Carlini氏の講演時点ではOpus 4.6、現在のGAフラッグシップはOpus 4.7 | Mythos Preview(12パートナーに制限) |
プロによる検証の数字は重要です。レビューされた198件の報告のうち89%が、独立したセキュリティ契約者によって深刻度の評価を確認され、98%が深刻度1段階以内に収まりました。1 これらは幻覚による発見ではありません。
制限の決定
Anthropicの公式な立場はこうです。「Claude Mythos Previewは、そのサイバーセキュリティ能力のため、一般提供する予定はありません。」4
この判断は際立っています。モデル企業は通常、能力を出荷しようと競争します。Anthropicは、公開されているどのシステムよりも脆弱性発見において明確に優れたモデルを構築した上で、審査を経たパートナーによる防御的利用に制限することを選んだのです。1億ドル相当の使用クレジットのコミットメントは、これがマーケティング上の演出ではないことを示しています。1
制限モデルには3つの段階があります。1 1. Project Glasswingパートナー(12組織):防御的セキュリティへの直接アクセス 2. より広いアクセス(合計40組織):監督付きデプロイメント 3. Cyber Verification Program(現在claude.com/form/cyber-use-caseで稼働中):認証されたセキュリティ専門家のための申請経路5
実践者にとって、標準のAPIとClaude Codeは、Mythosの脆弱性発見能力を公開しません。一般提供されている最強のモデルは現在Opus 4.7(2026年4月16日ローンチ)であり、Anthropicはこれを意図的にMythosよりサイバー能力を抑え、リアルタイムのサイバー セーフガードを搭載したものとして位置付けています。5 Mythosの実証された能力は、すでに4月16日のリリースに影響を与えています——Opus 4.7は、専用のサイバー セーフガードを備えたAnthropic初のポストGlasswingモデルなのです。
これが検証するもの
Project Glasswingは、実践者コミュニティが独自に構築したいくつかのパターンを検証しています。
実行スキャフォールドとしてのClaude Code。 Mythosは隔離されたコンテナ内でClaude Code経由で稼働します。1 実践者が日々のコーディングに使うのと同じエージェントのCLIが、フロンティアセキュリティ研究の実行レイヤーとして機能しているのです。Claude Codeが提供するフック、スキル、サンドボックス化は、利便性のための機能ではありません。自律的セキュリティスキャンを十分に安全にデプロイできるようにするインフラなのです。
検証のボトルネックはオーケストレーションの問題である。 Carlini氏の講演は、人間による検証をボトルネックとして特定しました。Project Glasswingの解決策は、検証のためのプロのセキュリティ契約者、責任ある開示のためのSHA-3ハッシュコミットメント、そして構造化されたトリアージのインフラです。1 同じトリアージの問題はエージェントが脆弱性を発見したときでも浮上しており、解決策はモデルの能力ではなくインフラにあります。
ガバナンスフックはスキャン能力より重要である。 モデルは脆弱性を発見できます。難しい問題は、開示をコントロールし、アクセスを管理し、発見が攻撃者より先に防御側に届くようにすることなのです。Anthropicの答えは組織的なものです(モデルを制限し、パートナーを審査し、リソースをコミットする)。自身のセキュリティスキャンを構築する実践者にとっては、出力をゲートするガバナンスフックが同等のものとなります。
実践者にとっての意味
Mythosへのアクセスは得られないでしょう。手元にあるもので何ができるかを以下に示します。
Opus 4.6はすでに有能です。 Carlini氏の[un]promptedでの結果(カーネルバグ5件、Firefox CVE 22件)は、MythosではなくOpus 4.6を使用したものでした。3 キャプチャー・ザ・フラッグの手法、ASAN計装済みビルド、ファイル反復スクリプトはすべて、一般提供されているモデルで再現可能です。
トリアージレイヤーを今から構築してください。 将来のOpusモデルがMythosの能力の一部を受け継いだ場合(Anthropicがほのめかしているように)、ボトルネックはCarlini氏が特定したものと同じ——人間による検証——になります。自動重複排除、深刻度分類、開示ワークフローを準備しているチームが最初に恩恵を受けるでしょう。
Cyber Verification Programに申請してください。 申請フォームはclaude.com/form/cyber-use-caseで稼働しています。正当なセキュリティ研究を行っているのであれば、これが昇格されたアクセスへの経路となります。
軌跡は明確です。AI支援の脆弱性発見は現実であり、スケールし、そして今やガバナンスの問いが中心的な問題となっています。モデルの能力は解決されました。発見、トリアージ、責任ある開示をオーケストレーションするスキャフォールドは、まだ解決されていないのです。
情報源
よくある質問
Claude Codeを通じてClaude Mythosを使えますか?
いいえ。Mythos PreviewはProject Glasswingパートナーに制限されています。Opus 4.7(2026年4月16日)は、一般ユーザーがClaude Code経由で利用できる最強のモデルです。Anthropicは、MythosはどのGAモデルよりもサイバー能力が高いままだと述べています。これは2026年4月時点の顔ぶれです。9月29日までに、Anthropicは審査を経た防御側が信頼済みアクセスプログラムを通じてClaude Mythos 5.1を利用できると述べています。上記の10月1日のアップデートを参照してください。
MythosのケイパビリティはOpusに来ますか?
Opus 4.7はAnthropic初のポストGlasswing Opusリリースであり、リアルタイム サイバー セーフガードを搭載して出荷されています。このパターンは、将来のOpusモデルがMythosの全能力エンベロープではなく、追加のセーフガードを帯びることを示唆しています。Anthropicの当初の発表では、「将来のClaude Opusモデルにおける新しいセーフガードを通じて、より安全なデプロイメントを可能にする」ことを目指すと述べていました。
これは以前の脆弱性のブログ記事とどう関係しますか?
Carlini氏の[un]prompted講演(エージェントが脆弱性を発見したときで取り上げています)ではOpus 4.6を使用し、カーネルバグ5件 + Firefox CVE 22件を発見しました。Mythosはそのアプローチを、主要なすべてのプラットフォーム横断で数千の脆弱性へとスケールさせました。手法は同じで、モデルがより高性能なのです。
-
Claude Mythos Preview — Project Glasswing. Anthropic、2026年4月7日。公式発表。深刻度が高い/致命的なゼロデイが数千件発見された。プロの検証者による深刻度確認率は89%。1億ドルの使用クレジット。Nicholas Carlini氏が率い、21名以上の共著者。 ↩↩↩↩↩↩↩↩↩↩↩
-
Anthropic’s Project Glasswing. Simon Willison、2026年4月7日。制限付きリリースモデルとCarlini氏の以前の業績に関する分析と文脈。 ↩
-
Nicholas Carlini, “Black-hat LLMs,” [un]prompted AIセキュリティカンファレンス、2026年4月。カンファレンスアジェンダ。関連:AI Finds Vulns You Can’t、Security Cryptography Whateverポッドキャスト。 ↩↩
-
Anthropic says its most powerful AI cyber model is too dangerous to release publicly. VentureBeat、2026年4月7日。 ↩
-
公開後のアップデート(2026年4月19日)。 AnthropicのIntroducing Claude Opus 4.7発表(2026年4月16日)は、Opus 4.7をGAフラッグシップとして位置付けつつ、Mythos Previewが引き続きよりサイバー能力が高いことを明記しています。リアルタイム サイバー セーフガードの詳細はAnthropic Support: Real-time cyber safeguards on Claudeにあります。Cyber Verification Programの申請フォームはclaude.com/form/cyber-use-caseで稼働中。 ↩↩↩↩
-
Claude Code CHANGELOG. v2.1.111はOpus 4.7ローンチサポート(xhighエフォート、フラグなしのMax向けAuto Mode)を追加。v2.1.113は
sandbox.network.deniedDomains、ラッパーコマンドの拒否ルール、find -exec/-deleteの権限強化、macOS/private/{etc,var,tmp,home}削除保護を追加。 ↩ -
Andrew Fasano、Marius Fleischer、Cole McFaul、Robert Xiao、Tripp Gallagher、“GLM-5.3 and the spread of advanced cyber capabilities”。Anthropic Frontier Red Team、2026年9月29日、2026年10月1日に取得。この投稿から引用または参照したもの:Glasswingの先行期間に関する冒頭部分、ExploitBenchとバイナリエクスプロイトの結果(後者は無作為に選ばれた100タスク)、GLM-5.3のブラウザセッション、GLM-5.3-FlashによるNデイのセッション、「anyone can download GLM-5.3」、abliterationのコストと拒否率への影響(経験のあるチームについての脚注3の見積もりを含む)、リリースから数日以内に公開されたabliterated版、拒否に関する脚注2、回避率(64%、92%、100%)とFigure 5による「応じる」の定義(標的への接続を試みたこと。各セル50サンプル)、そして「What does this mean?」。Anthropicは、このシミュレーション環境ではモデルが生成したコードを一切実行しないと記しています。 ↩↩↩↩
-
NIST Center for AI Standards and Innovation、“CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities”。2026年9月17日、2026年10月1日に取得。「GLM-5.3 is the most cyber-capable open-weight model released to date」、「GLM-5.3’s cyber capabilities are significantly lower than those of current U.S. frontier models」、および「lags the capability level of the U.S. frontier by about four months in an aggregate measure of performance across CAISI cyber benchmarks」。Methodological Notesは「U.S. frontier best」を「including both trusted-access releases and full public releases」と定義し、「when applicable, U.S. models were tested with cyber safeguards disabled」と記しています。 ↩