← 所有文章

Project Glasswing:當模型找到太多漏洞時

出自指南: Claude Code Comprehensive Guide

兩週前,Nicholas Carlini展示了Claude Code可使用一個10行的bash腳本,找出一個存在23年的Linux核心漏洞。今天,Anthropic宣布了當他們將該方法規模化後發生的事:一個名為Claude Mythos的新模型找出了數千個高風險與嚴重等級的零日漏洞,隨後決定不公開發布它。1

Project Glasswing是Anthropic針對Claude Mythos的限制性部署,這是一個前沿模型,已在所有主要作業系統與網頁瀏覽器中發現了數千個零日漏洞。 Mythos找出了多個關鍵漏洞,包括一個存在27年的OpenBSD TCP SACK缺陷,以及一個FreeBSD NFS遠端程式碼執行漏洞。Anthropic將存取權限限制給12個合作夥伴組織,僅供防禦性安全用途,承諾提供1億美元的使用額度,並在claude.com/form/cyber-use-case開放Cyber Verification Program申請表單,供合格的研究人員提出申請。

Project Glasswing是Anthropic對於從業者自Carlini的[un]prompted演講以來一直追問之問題的回答:當這項能力被大規模部署時會發生什麼?答案是:你必須限制它。

摘要

Claude Mythos Preview是一個前沿模型,根據Anthropic的說法,其網路安全能力是「程式碼、推理與自主性整體進步的下游結果」。1 Anthropic將其定位為比任何普遍可用的Opus模型(包括2026年4月16日發布的Opus 4.7)更具網路能力,並將存取權限限制給12個合作夥伴組織(Apple、Amazon、Microsoft、Google、Linux Foundation等),僅限於防禦性安全工作。該模型找出了數千個零日漏洞,包括一個存在27年的OpenBSD TCP SACK漏洞、一個存在16年的FFmpeg漏洞,以及一個FreeBSD NFS RCE(CVE-2026-4747)。1 Anthropic承諾提供1億美元的使用額度,以及400萬美元給開源安全組織。Cyber Verification Program申請表單現已上線,供尋求存取權限的合法安全研究人員使用。1 下方2026年10月1日的更新介紹了GLM-5.3:一個開放權重模型,據Anthropic報告,它在ExploitBench上針對已知V8漏洞開發端到端漏洞利用程式的成功率,與Mythos Preview大致相當。7

重點摘要

  • 安全工程師: Carlini在[un]prompted演講中展示的能力門檻是真實的,而且可以擴展。Mythos在「所有主要作業系統與網頁瀏覽器」中找出了漏洞。2 12個合作夥伴組織的防禦性安全團隊現已擁有存取權限。其他人都應該為這些能力進入普遍可用模型時做好準備。(到了2026年9月,Anthropic報告已有一個開放權重模型在ExploitBench上的成功率與Mythos Preview大致相當,410次嘗試中為50次對56次;請見10月1日的更新。)
  • 架構建構者: Mythos透過Claude Code在隔離容器中執行。1 該架構模式(代理CLI+沙箱化執行+自動化分類)現在已成為Anthropic自身前沿安全研究的生產架構。從業者獨立建構的編排模式在最高層級依然成立。
  • 其他所有人: Anthropic選擇了限制而非發布。這是一個帶有真實取捨的真實治理決策。模型存在。Anthropic展示了能力。問題不再是AI能否找出零日漏洞,而是誰能取得存取權限以及在何種約束下。

更新(2026年10月1日):能力已進入開放權重模型

依Anthropic自己的回顧,Glasswing是一場押注領先時間的賭局:限制模型、讓防禦者先用,同時預期這項能力終究會擴散。9月29日,Anthropic的Frontier Red Team表示擴散已經發生:「those models have now arrived」(那些模型如今已經到來)。7 在ExploitBench(一組已知的V8漏洞)上,來自Zhipu AI(Z.ai)的開放權重模型GLM-5.3「develops end-to-end exploits in 50 of 410 attempts」(在410次嘗試中有50次開發出端到端漏洞利用程式),而Claude Mythos Preview「did so at a similar rate」(成功率相近),為410次中的56次。在Anthropic內部二進位漏洞利用基準測試中隨機選出的100項任務上,GLM-5.3在4%的試驗中達成完整的控制流程劫持,Mythos Preview則為6%;而「earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them」(較早的模型,例如Claude Opus 4.6與GLM-5.2,一項也未能成功)。NIST的CAISI在9月17日發表的自家評估中,稱GLM-5.3為「the most cyber-capable open-weight model released to date」(迄今發布的網路能力最強的開放權重模型),同時認為其能力「significantly lower than those of current U.S. frontier models」(明顯低於目前美國的前沿模型),落後它們「about four months」(約四個月);依CAISI的註記,這個前沿既包括透過受信任存取管道發布的模型,也包括公開發布的模型,而這些美國模型在適用時是於停用網路安全防護的情況下測試的。8

與本文相關的是防護機制。上述漏洞利用開發任務完全沒有觸發已發布模型的拒絕機制;以下的數字涵蓋的是明顯惡意的請求。在Anthropic的模擬測試中,GLM-5.3拒絕了每一個直接且明顯惡意的請求;但套上一個掩護說詞,就有64%的機率讓它投入(意即嘗試連線到模擬目標),預先填入推理內容可達92%,而一份abliterated副本(經過編輯、使其不再拒絕的副本)則達100%。這項編輯讓三個公開基準測試上的拒絕率從90%以上降到2%至12%之間;Anthropic的團隊此前從未做過這件事,耗費了「about 2,200 GPU hours at a computation cost of roughly $4,400」(約2,200個GPU小時,運算成本約$4,400)。Anthropic估計,有經驗的團隊大約只需$1,200,並指出模型發布後數天內,abliterated副本就已公開流傳。權重是公開的:「anyone can download GLM-5.3」(任何人都能下載GLM-5.3)。一次工作階段便顯示了代價。一位研究人員把一個近期揭露的Chrome缺陷以及另一個缺陷的公開細節交給較小的GLM-5.3-Flash,它便「chained together exploits for these two flaws, building a reliable exploit chain for an ARM64 target」(把這兩個缺陷的漏洞利用串接起來,為ARM64目標建構出一條可靠的漏洞利用鏈),所需的是「20 minutes of human attention, plus eight hours of work」(20分鐘的人力關注,再加上八小時的工作),後者由模型完成。Anthropic為此算出的價格是:「At Zhipu’s API prices, this effort would have cost $20.40.」(以Zhipu的API價格計算,這項工作的成本為$20.40。)7

這對下文的論點意味著什麼?限制換來的是領先時間,而不是獨占。用Anthropic的話說:「a critical threshold in freely accessible capabilities has now been crossed」(可自由取得之能力的一道關鍵門檻如今已被跨越)。對從業者的建議沒有改變方向,只是更加急迫。分類層、揭露工作流程與修補節奏如今承擔起重任,因為達到約Mythos Preview在ExploitBench上成功率的漏洞利用開發能力,以及(在另一次由研究人員使用完整版GLM-5.3的工作階段中)發現並串接網頁瀏覽器中先前未知之漏洞的能力,現在都只要下載即可取得。下文Opus 4.6找漏洞的成果依然成立;在Anthropic二進位漏洞利用基準測試的同樣100項隨機任務上,它一次完整的控制流程劫持也沒有達成。同一篇文章也指出,經審核的防禦者「can now use even more advanced models like Claude Mythos 5.1 through our trusted access programs」(現在可以透過我們的受信任存取計畫,使用如Claude Mythos 5.1等更先進的模型),可見受限存取本身也已經往前推進。這些計畫是否就是本文所描述的申請途徑,Anthropic的文章並未說明。7 下文各節中的模型名稱是4月時的名稱;閱讀時請記住這個日期。


更新(2026年4月19日)

自本文於4月7日上線以來,有兩件事發生變化:

  1. Opus 4.7於2026年4月16日發布,成為新的普遍可用旗艦模型。Anthropic表示Opus 4.7在網路能力上刻意低於Mythos Preview,並配備了即時網路防護機制。Mythos Preview仍維持獨立且受限制。5
  2. Cyber Verification Program申請表單現已上線,網址為claude.com/form/cyber-use-case。原本公告中所稱的「未來」計畫,現在已是一條具體的申請路徑。5
  3. Claude Code發布了兩個相關的基礎設施版本:v2.1.111新增了Opus 4.7/xhigh/Auto Mode支援;v2.1.113新增了sandbox.network.deniedDomains、包裝命令拒絕規則(env/sudo/watch/ionice/setsid)、更嚴格的find -exec/-delete處理,以及在Bash(rm:*)下的macOS /private/{etc,var,tmp,home}刪除保護。6 這些正是Mythos風格的安全研究架構所需要的強化基礎元件。

下面的核心論點——能力限制優於發布、架構模式在最高層級依然成立、其他所有人都應為這些能力進入GA做好準備——並未改變。如果有什麼變化的話,Opus 4.7明確的網路防護框架反而更強化了這項論點。


從演講到產品

Carlini在4月初的[un]prompted演講是公開預覽。3 他展示了使用一個簡單的檔案迭代腳本所找出的5個Linux核心漏洞與22個Firefox CVE。他說瓶頸在於人工驗證——「還有數百個我尚未驗證的崩潰」。

Mythos是當你以更強大的模型與專屬基礎設施移除該瓶頸後所發生的事。其規模差異相當顯著:1

指標 Carlini的演講 Project Glasswing
找出的漏洞數 5個核心+22個Firefox CVE 跨所有主要平台的數千個
目標 Linux核心、Firefox 所有主要OS、瀏覽器、開源專案
驗證方式 手動,由研究人員主導 專業安全承包商,89%嚴重程度確認率
存取權限 Carlini演講時為Opus 4.6;Opus 4.7現為GA旗艦 Mythos Preview(限12個合作夥伴)

專業驗證的數字至關重要:在198份審查報告中,89%的嚴重程度評估獲得獨立安全承包商確認,98%在一個嚴重程度等級之內。1 這些並非幻覺生成的發現。

限制決策

Anthropic的官方立場:「由於Claude Mythos Preview的網路安全能力,我們不打算將其普遍提供。」4

該決策格外引人注目。模型公司通常會競相推出新能力。Anthropic打造了一個在尋找漏洞方面明顯優於任何公開可用系統的模型,然後選擇將其限制給經審核的合作夥伴用於防禦用途。1億美元的使用額度承諾顯示這並非行銷活動。1

該限制模型分為三個層級:1 1. Project Glasswing合作夥伴(12個組織):直接存取權限,用於防禦性安全 2. 更廣泛的存取(總計40個組織):受監督部署 3. Cyber Verification Program(現已於claude.com/form/cyber-use-case上線):經驗證安全專業人員的申請路徑5

對從業者而言,標準的API與Claude Code並未開放Mythos的漏洞發現能力。目前最強大的普遍可用模型是Opus 4.7(於2026年4月16日推出),Anthropic將其定位為在網路能力上刻意低於Mythos,並配備即時網路防護機制。5 Mythos所展示的能力已影響了該4月16日的發布——Opus 4.7是Anthropic首個後Glasswing時代、配備專屬網路防護機制的模型。

此事驗證了什麼

Project Glasswing驗證了從業者社群獨立建構的數種模式:

Claude Code作為執行架構。 Mythos透過Claude Code在隔離容器中執行。1 從業者日常編程所使用的同一個代理CLI,現在也作為前沿安全研究的執行層。Claude Code所提供的hooks、skills與沙箱機制並非便利功能。它們是讓自主安全掃描得以安全部署的基礎設施。

驗證瓶頸是一個編排問題。 Carlini的演講指出人工驗證是瓶頸。Project Glasswing的解決方案:專業安全承包商進行驗證、SHA-3雜湊承諾以負責任揭露,以及結構化的分類基礎設施。1 同樣的分類問題在當您的代理找到漏洞時中浮現,而解決方案是基礎設施,而非模型能力。

治理機制比掃描能力更重要。 模型可以找出漏洞。困難的問題是控制揭露、管理存取權限,並確保發現能在攻擊者之前傳達給防禦者。Anthropic的答案是組織性的(限制模型、審核合作夥伴、投入資源)。對於建構自有安全掃描系統的從業者而言,把關輸出的治理機制就是其等同物。

此事對從業者的意義

您不會獲得Mythos的存取權限。以下是您可以利用現有資源做的事:

Opus 4.6本身已具備能力。 Carlini的[un]prompted成果(5個核心漏洞、22個Firefox CVE)使用的是Opus 4.6,而非Mythos。3 奪旗賽方法論、ASAN儀器化建置與檔案迭代腳本,全都可以用普遍可用的模型重現。

現在就建構分類層。 當未來的Opus模型繼承部分Mythos的能力時(如同Anthropic所暗示的),瓶頸將會與Carlini所指出的相同:人工驗證。已備妥自動化去重複、嚴重程度分類與揭露工作流程的團隊將最先受益。

申請Cyber Verification Program。 申請表單已於claude.com/form/cyber-use-case上線。如果您從事合法的安全研究,這是取得進階存取權限的途徑。

軌跡相當清晰:AI輔助的漏洞發現是真實的、可擴展的,治理問題現在已成為核心議題。模型能力問題已被解決。但編排發現、分類與負責任揭露的架構尚未解決。


來源

常見問題

我可以透過Claude Code使用Claude Mythos嗎?

不可以。Mythos Preview僅限Project Glasswing合作夥伴使用。Opus 4.7(2026年4月16日)是一般使用者透過Claude Code可用的最強大模型;Anthropic表示Mythos的網路能力仍高於任何GA模型。以上是2026年4月時的陣容。到了9月29日,Anthropic表示經審核的防禦者可以透過其受信任存取計畫使用Claude Mythos 5.1;請見上方10月1日的更新。

Mythos的能力會出現在Opus上嗎?

Opus 4.7是Anthropic首個後Glasswing時代的Opus版本,並配備即時網路防護機制。此模式表明未來的Opus模型將攜帶額外的防護機制,而非完整的Mythos能力範圍。Anthropic的原始公告表示,他們的目標是「透過未來Claude Opus模型中的新防護機制實現更安全的部署」。

此事與先前的漏洞部落格文章有何關聯?

Carlini的[un]prompted演講(在當您的代理找到漏洞時中介紹)使用了Opus 4.6,找出5個核心漏洞與22個Firefox CVE。Mythos將該方法擴展到所有主要平台的數千個漏洞。方法論相同;模型更強大。


  1. Claude Mythos Preview — Project Glasswing。Anthropic,2026年4月7日。官方公告。找出數千個高/嚴重程度的零日漏洞。專業驗證者89%嚴重程度確認率。1億美元使用額度。由Nicholas Carlini領導,21名以上共同作者。 ↩↩↩↩↩↩↩↩↩↩↩

  2. Anthropic’s Project Glasswing。Simon Willison,2026年4月7日。對受限發布模型與Carlini早期工作的分析與背景說明。 ↩

  3. Nicholas Carlini,「Black-hat LLMs」,[un]prompted AI安全研討會,2026年4月。研討會議程。亦見:AI Finds Vulns You Can’t,Security Cryptography Whatever podcast。 ↩↩

  4. Anthropic says its most powerful AI cyber model is too dangerous to release publicly。VentureBeat,2026年4月7日。 ↩

  5. 發布後更新(2026年4月19日)。 Anthropic的Introducing Claude Opus 4.7公告(2026年4月16日)將Opus 4.7定位為GA旗艦,同時指出Mythos Preview在網路能力上仍更為強大。即時網路防護機制詳情請見Anthropic Support: Real-time cyber safeguards on Claude。Cyber Verification Program申請表單已於claude.com/form/cyber-use-case上線。 ↩↩↩↩

  6. Claude Code CHANGELOG。v2.1.111新增Opus 4.7發布支援(xhigh effort、Max的Auto Mode無需旗標)。v2.1.113新增sandbox.network.deniedDomains、包裝命令拒絕規則、find -exec/-delete權限收緊,以及macOS /private/{etc,var,tmp,home}刪除保護。 ↩

  7. Andrew Fasano、Marius Fleischer、Cole McFaul、Robert Xiao與Tripp Gallagher,GLM-5.3 and the spread of advanced cyber capabilities。Anthropic Frontier Red Team,2026年9月29日,擷取於2026年10月1日。引用或取材自該文的內容:開頭關於Glasswing領先時間的段落、ExploitBench與二進位漏洞利用的結果(後者為100項隨機選出的任務)、GLM-5.3的瀏覽器工作階段、使用GLM-5.3-Flash的N-day工作階段、「anyone can download GLM-5.3」、abliteration的成本及其對拒絕率的影響(連同註腳3對有經驗團隊的估計)、發布後數天內即公開的abliterated副本、關於拒絕的註腳2、繞過率(64%、92%、100%)以及圖5對「投入」的定義(嘗試連線到目標;每格50個樣本),還有「What does this mean?」一節。Anthropic指出,其模擬環境不會執行任何模型生成的程式碼。 ↩↩↩↩

  8. NIST Center for AI Standards and Innovation,CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities。2026年9月17日,擷取於2026年10月1日:「GLM-5.3 is the most cyber-capable open-weight model released to date」、「GLM-5.3’s cyber capabilities are significantly lower than those of current U.S. frontier models」以及「lags the capability level of the U.S. frontier by about four months in an aggregate measure of performance across CAISI cyber benchmarks」;Methodological Notes將「U.S. frontier best」定義為「including both trusted-access releases and full public releases」,並指出「when applicable, U.S. models were tested with cyber safeguards disabled」。 ↩

相關文章

程式碼倉庫不該為自己的信任投票

37天內出現兩個Claude Code信任對話框繞過CVE,揭示了載入順序的失敗。一條不變式即可解決:在路徑被信任之前,不解讀工作區內的任何位元組。

10 分鐘閱讀

MCP 伺服器是新的攻擊面

50 個 MCP 漏洞,60 天內 30 個 CVE,13 個嚴重等級。工具使用協定是無人稽核的攻擊面——以下是分類與修復方案。

6 分鐘閱讀

Ralph 迴圈:我如何在夜間運行自主 AI 代理

我建構了一套自主代理系統,搭配停止鉤子、生成預算與檔案系統記憶體。以下是失敗經驗與真正能交付程式碼的方法。

9 分鐘閱讀