← Wszystkie wpisy

Projekt Glasswing: Kiedy model znajduje zbyt wiele błędów

Z przewodnika: Claude Code Comprehensive Guide

Dwa tygodnie temu Nicholas Carlini pokazał, że Claude Code potrafi znaleźć 23-letnią podatność w jądrze Linux przy użyciu 10-liniowego skryptu bash. Dziś Anthropic ogłosiło, co się stało, gdy to podejście zostało przeskalowane: nowy model o nazwie Claude Mythos odnalazł tysiące podatności zero-day o wysokiej i krytycznej istotności, po czym zdecydowano nie udostępniać go publicznie.1

Projekt Glasswing to ograniczone wdrożenie Claude Mythos przez Anthropic — model pionierski, który odkrył tysiące podatności zero-day w każdym głównym systemie operacyjnym i przeglądarce internetowej. Mythos znalazł krytyczne błędy, w tym 27-letnią lukę TCP SACK w OpenBSD oraz podatność umożliwiającą zdalne wykonanie kodu w FreeBSD NFS. Anthropic ograniczyło dostęp do 12 organizacji partnerskich wyłącznie do celów bezpieczeństwa defensywnego, przeznaczyło 100 mln USD w kredytach użytkowych i uruchomiło formularz aplikacyjny Cyber Verification Program pod adresem claude.com/form/cyber-use-case dla wykwalifikowanych badaczy.

Projekt Glasswing to odpowiedź Anthropic na pytanie, które praktycy zadawali od czasu prelekcji Carliniego na [un]prompted: co się dzieje, gdy ta zdolność zostaje wdrożona na dużą skalę? Odpowiedź: wprowadza się ograniczenia.

TL;DR

Claude Mythos Preview to model pionierski, którego zdolności cyberbezpieczeństwa, według Anthropic, „wyłoniły się jako konsekwencja wtórna ogólnych usprawnień w kodowaniu, rozumowaniu i autonomii”.1 Anthropic pozycjonuje go jako bardziej zaawansowany w obszarze cyber niż jakikolwiek ogólnodostępny model Opus (w tym wydanie Opus 4.7 z 16 kwietnia 2026 r.) i ogranicza dostęp do 12 organizacji partnerskich (Apple, Amazon, Microsoft, Google, Linux Foundation i innych) wyłącznie na potrzeby prac z zakresu bezpieczeństwa defensywnego. Model znalazł tysiące zero-dayów, w tym 27-letni błąd TCP SACK w OpenBSD, 16-letnią podatność FFmpeg oraz zdalne wykonanie kodu w FreeBSD NFS (CVE-2026-4747).1 Anthropic przeznaczyło 100 mln USD w kredytach użytkowych oraz 4 mln USD dla organizacji open-source zajmujących się bezpieczeństwem. Formularz aplikacyjny Cyber Verification Program jest obecnie aktywny dla rzetelnych badaczy bezpieczeństwa ubiegających się o dostęp.1 Aktualizacja z 1 października 2026 r. poniżej omawia GLM-5.3, model o otwartych wagach, który według Anthropic tworzy kompletne exploity dla znanych błędów V8 w ExploitBench mniej więcej w tym samym tempie co Mythos Preview.7

Kluczowe wnioski

  • Inżynierowie bezpieczeństwa: Próg zdolności, który Carlini zademonstrował na [un]prompted, jest realny i skaluje się. Mythos znalazł podatności w „każdym głównym systemie operacyjnym i przeglądarce internetowej”.2 Zespoły bezpieczeństwa defensywnego w 12 organizacjach partnerskich mają teraz dostęp. Wszyscy pozostali powinni przygotowywać się na to, co nastąpi, gdy te zdolności trafią do ogólnodostępnych modeli. (We wrześniu 2026 r. Anthropic opisało już model o otwartych wagach osiągający w ExploitBench wynik zbliżony do Mythos Preview: 50 wobec 56 na 410 prób; zob. aktualizację z 1 października).
  • Twórcy scaffoldów: Mythos działa przez Claude Code w izolowanych kontenerach.1 Wzorzec scaffoldu (agent CLI + wykonywanie w sandboksie + zautomatyzowana triaż) służy teraz jako architektura produkcyjna dla pionierskich badań bezpieczeństwa w samym Anthropic. Wzorce orkiestracji, które praktycy budowali niezależnie, wytrzymują próbę na najwyższym poziomie.
  • Wszyscy pozostali: Anthropic wybrało ograniczenie zamiast wydania. To realna decyzja w zakresie zarządzania z realnymi kompromisami. Model istnieje. Anthropic zademonstrowało jego możliwości. Pytanie nie brzmi już, czy AI potrafi znajdować zero-daye, lecz kto uzyskuje dostęp i pod jakimi warunkami.

Aktualizacja (1 października 2026): zdolności trafiły do modeli o otwartych wagach

We własnej relacji Anthropic Glasswing był zakładem o przewagę na starcie: ograniczyć dostęp do modelu, dać obrońcom skorzystać z niego jako pierwszym i liczyć się z tym, że zdolności i tak się rozprzestrzenią. 29 września Frontier Red Team Anthropic stwierdził, że to rozprzestrzenienie nastąpiło: „those models have now arrived” (te modele już się pojawiły).7 GLM-5.3, model o otwartych wagach od Zhipu AI (Z.ai), „develops end-to-end exploits in 50 of 410 attempts” (tworzy kompletne exploity w 50 na 410 prób) w ExploitBench, zbiorze znanych podatności V8, w którym Claude Mythos Preview „did so at a similar rate” (robił to w podobnym tempie), 56 na 410. Na 100 losowo wybranych zadaniach z wewnętrznego benchmarku Anthropic dotyczącego eksploatacji plików binarnych osiągnął pełne przejęcie przepływu sterowania w 4% prób, wobec 6% dla Mythos Preview, a „earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them” (wcześniejsze modele, takie jak Claude Opus 4.6 i GLM-5.2, nie radzą sobie z żadnym z nich). CAISI przy NIST we własnej ocenie nazwało 17 września GLM-5.3 „the most cyber-capable open-weight model released to date” (najbardziej zaawansowanym w obszarze cyber modelem o otwartych wagach, jaki dotąd wydano), uznając jednocześnie jego zdolności za „significantly lower than those of current U.S. frontier models” (znacznie niższe niż w obecnych amerykańskich modelach pionierskich) i opóźnione względem nich o „about four months” (około cztery miesiące). Według uwag CAISI ta czołówka obejmuje zarówno wydania publiczne, jak i udostępniane w ramach zaufanego dostępu, a modele amerykańskie testowano w stosownych przypadkach z wyłączonymi zabezpieczeniami cyber.8

Dla tego wpisu istotne są zabezpieczenia. Opisane wyżej zadania tworzenia exploitów w ogóle nie wywołały odmów wydanego modelu; liczby poniżej dotyczą jawnie złośliwych próśb. W symulowanych testach Anthropic GLM-5.3 odrzucił każdą bezpośrednią, jawnie złośliwą prośbę; zmyślona przykrywka skłoniła go do zaangażowania, czyli do próby połączenia się z symulowanym celem, w 64% przypadków, wstępnie wypełnione rozumowanie w 92%, a kopia abliterated (zmodyfikowana tak, by przestała odmawiać) w 100%. Ta modyfikacja, która obniżyła odsetek odmów w trzech publicznych benchmarkach z ponad 90% do od 2% do 12%, kosztowała zespół Anthropic, który wcześniej tego nie robił, „about 2,200 GPU hours at a computation cost of roughly $4,400” (około 2200 godzin GPU przy koszcie obliczeń rzędu $4,400); Anthropic szacuje, że doświadczony zespół potrzebowałby około $1,200, i zaznacza, że kopie abliterated były publicznie dostępne w ciągu kilku dni od wydania. Wagi są publiczne: „anyone can download GLM-5.3” (każdy może pobrać GLM-5.3). Cenę pokazuje jedna sesja. Badacz przekazał mniejszemu GLM-5.3-Flash publiczne szczegóły niedawno ujawnionej luki w Chrome oraz jednej innej, a model „chained together exploits for these two flaws, building a reliable exploit chain for an ARM64 target” (połączył exploity dla tych dwóch luk, budując niezawodny łańcuch exploitów dla celu ARM64) przy „20 minutes of human attention, plus eight hours of work” (20 minutach uwagi człowieka i ośmiu godzinach pracy) modelu. Wycena Anthropic: „At Zhipu’s API prices, this effort would have cost $20.40” (przy cenach API Zhipu ten wysiłek kosztowałby $20.40).7

Co to oznacza dla argumentu poniżej. Ograniczenie kupiło przewagę na starcie, a nie wyłączność. Słowami Anthropic: „a critical threshold in freely accessible capabilities has now been crossed” (krytyczny próg w swobodnie dostępnych zdolnościach został właśnie przekroczony). Rady dla praktyków stają się pilniejsze, a nie inne. Ciężar spoczywa teraz na warstwie triażu, procesie ujawniania i rytmie łatek, ponieważ tworzenie exploitów mniej więcej w tempie Mythos Preview w ExploitBench, a w osobnej sesji badacza z pełnym GLM-5.3 także odkrywanie wcześniej nieznanych podatności w przeglądarce internetowej i łączenie ich w łańcuch, są teraz dostępne do pobrania. Opisane niżej wyniki Opus 4.6 w wyszukiwaniu błędów pozostają aktualne; na tych samych 100 losowo wybranych zadaniach z benchmarku eksploatacji plików binarnych Anthropic nie osiągnął on ani jednego pełnego przejęcia przepływu sterowania. Ten sam wpis zaznacza, że zweryfikowani obrońcy „can now use even more advanced models like Claude Mythos 5.1 through our trusted access programs” (mogą teraz korzystać z jeszcze bardziej zaawansowanych modeli, takich jak Claude Mythos 5.1, w ramach naszych programów zaufanego dostępu), więc i ograniczony dostęp poszedł naprzód. Czy te programy są ścieżką aplikacyjną opisaną w tym wpisie, wpis Anthropic nie mówi.7 Nazwy modeli w sekcjach poniżej pochodzą z kwietnia; należy je czytać z uwzględnieniem tej daty.


Aktualizacja (19 kwietnia 2026)

Od publikacji tego wpisu 7 kwietnia zmieniły się dwie rzeczy:

  1. Opus 4.7 trafił na rynek 16 kwietnia 2026 r. jako nowy ogólnodostępny flagowiec. Anthropic stwierdza, że Opus 4.7 jest celowo mniej zaawansowany w obszarze cyber niż Mythos Preview i posiada wbudowane zabezpieczenia cyber w czasie rzeczywistym. Mythos Preview pozostaje osobnym, ograniczonym modelem.5
  2. Formularz aplikacyjny Cyber Verification Program jest aktualnie dostępny pod adresem claude.com/form/cyber-use-case. To, co pierwotne ogłoszenie określało jako „przyszły” program, stało się konkretną ścieżką aplikacyjną.5
  3. Claude Code otrzymało dwa istotne wydania infrastrukturalne: v2.1.111 dodało obsługę Opus 4.7 / xhigh / Auto Mode; v2.1.113 dodało sandbox.network.deniedDomains, reguły odmowy dla poleceń opakowujących (env / sudo / watch / ionice / setsid), surowszą obsługę find -exec / -delete oraz ochronę przed usunięciem katalogów /private/{etc,var,tmp,home} w macOS w ramach Bash(rm:*).6 Są to dokładnie takie prymitywy wzmacniające, jakich potrzebuje scaffold badawczy w stylu Mythos.

Zasadniczy argument poniżej — ograniczanie zdolności zamiast ich udostępniania, utrzymanie się wzorców scaffoldu na najwyższym poziomie, konieczność przygotowania się przez wszystkich pozostałych na moment, gdy te zdolności trafią do GA — pozostaje niezmieniony. Jeśli cokolwiek, to jawne zabezpieczenia cyber Opus 4.7 dodatkowo go wzmacniają.


Od prelekcji do produktu

Prelekcja Carliniego na [un]prompted z początku kwietnia była publiczną zapowiedzią.3 Pokazał pięć podatności w jądrze Linux oraz 22 CVE w Firefoksie znalezione za pomocą prostego skryptu iterującego po plikach. Wąskim gardłem, jak stwierdził, była weryfikacja ludzka — „kilkaset crashów, których jeszcze nie zwalidowałem”.

Mythos to efekt usunięcia tego wąskiego gardła dzięki bardziej zaawansowanemu modelowi i dedykowanej infrastrukturze. Różnica skali jest znacząca:1

Metryka Prelekcja Carliniego Projekt Glasswing
Znalezione podatności 5 w jądrze + 22 CVE Firefoksa Tysiące na wszystkich głównych platformach
Cele Jądro Linux, Firefox Każdy główny OS, przeglądarka, projekt open-source
Walidacja Ręczna, prowadzona przez badacza Profesjonalni wykonawcy ds. bezpieczeństwa, 89% potwierdzenia istotności
Dostęp Opus 4.6 w czasie prelekcji Carliniego; Opus 4.7 jest obecnie flagowcem GA Mythos Preview (ograniczony do 12 partnerów)

Liczba dotycząca profesjonalnej walidacji ma znaczenie: w 89% z 198 zweryfikowanych raportów oceny istotności zostały potwierdzone przez niezależnych wykonawców ds. bezpieczeństwa, przy czym 98% mieściło się w zakresie jednego poziomu istotności.1 To nie są zmyślone wyniki.

Decyzja o ograniczeniu

Stanowisko Anthropic brzmi: „Nie planujemy ogólnego udostępnienia Claude Mythos Preview ze względu na jego zdolności w obszarze cyberbezpieczeństwa”.4

Ta decyzja się wyróżnia. Firmy modelowe zazwyczaj prześcigają się w udostępnianiu zdolności. Anthropic zbudowało model w sposób wymierny lepszy w znajdowaniu podatności niż jakikolwiek publicznie dostępny system, a następnie zdecydowało się ograniczyć jego użycie do zastosowań defensywnych przez zweryfikowanych partnerów. Zobowiązanie 100 mln USD w kredytach użytkowych sygnalizuje, że nie jest to ćwiczenie marketingowe.1

Model ograniczeń ma trzy poziomy:1 1. Partnerzy Projektu Glasswing (12 organizacji): Bezpośredni dostęp do zastosowań bezpieczeństwa defensywnego 2. Szerszy dostęp (łącznie 40 organizacji): Nadzorowane wdrożenie 3. Cyber Verification Program (obecnie aktywny pod adresem claude.com/form/cyber-use-case): Ścieżka aplikacyjna dla zweryfikowanych specjalistów bezpieczeństwa5

Dla praktyków standardowe API i Claude Code nie udostępniają zdolności Mythos do wyszukiwania podatności. Najmocniejszym ogólnodostępnym modelem jest obecnie Opus 4.7 (wydany 16 kwietnia 2026 r.), który Anthropic pozycjonuje jako celowo mniej zaawansowany w obszarze cyber niż Mythos i wyposaża w zabezpieczenia cyber działające w czasie rzeczywistym.5 Zademonstrowane zdolności Mythos już wpłynęły na to wydanie z 16 kwietnia — Opus 4.7 jest pierwszym modelem Anthropic po Glasswing z dedykowanymi zabezpieczeniami cyber.

Co to potwierdza

Projekt Glasswing potwierdza kilka wzorców, które społeczność praktyków budowała niezależnie:

Claude Code jako scaffold wykonawczy. Mythos działa przez Claude Code w izolowanych kontenerach.1 Ten sam agent CLI, którego praktycy używają do codziennego kodowania, pełni rolę warstwy wykonawczej dla pionierskich badań bezpieczeństwa. Hooki, umiejętności oraz sandboxing, które zapewnia Claude Code, nie są udogodnieniami. To infrastruktura, która sprawia, że autonomiczne skanowanie bezpieczeństwa jest na tyle bezpieczne, by można je wdrożyć.

Wąskie gardło weryfikacji to problem orkiestracji. Prelekcja Carliniego wskazała weryfikację ludzką jako wąskie gardło. Rozwiązanie Projektu Glasswing: profesjonalni wykonawcy ds. bezpieczeństwa do walidacji, zobowiązania oparte na skrótach SHA-3 na potrzeby odpowiedzialnego ujawniania i ustrukturyzowana infrastruktura triażu.1 Ten sam problem triażu pojawił się w Gdy Twój agent znajduje podatność, a rozwiązaniem jest infrastruktura, a nie zdolność modelu.

Hooki zarządzania znaczą więcej niż zdolność skanowania. Model potrafi znaleźć podatności. Trudnym problemem jest kontrolowanie ujawniania, zarządzanie dostępem i zapewnianie, że znaleziska dotrą do obrońców przed atakującymi. Odpowiedzią Anthropic jest organizacja (ograniczenie modelu, weryfikacja partnerów, zaangażowanie zasobów). Dla praktyków budujących własne skanowanie bezpieczeństwa odpowiednikiem są hooki zarządzania, które bramkują wyniki.

Co to oznacza dla praktyków

Dostępu do Mythos nie otrzymasz. Oto, co możesz zrobić z tym, co masz:

Opus 4.6 jest już zdolny. Wyniki Carliniego z [un]prompted (5 błędów jądra, 22 CVE Firefoksa) korzystały z Opus 4.6, a nie z Mythos.3 Metodologia capture-the-flag, kompilacje z instrumentacją ASAN oraz skrypt iterujący po plikach są w pełni odtwarzalne z wykorzystaniem ogólnodostępnego modelu.

Zbuduj teraz warstwę triażu. Gdy przyszłe modele Opus przejmą część zdolności Mythos (na co Anthropic wskazało pośrednio), wąskim gardłem będzie to samo, co zidentyfikował Carlini: weryfikacja ludzka. Zespoły, które mają gotową zautomatyzowaną deduplikację, klasyfikację istotności i procesy ujawniania, skorzystają jako pierwsze.

Złóż wniosek do Cyber Verification Program. Formularz aplikacyjny jest aktywny pod adresem claude.com/form/cyber-use-case. W przypadku prowadzenia rzetelnych badań bezpieczeństwa to droga do podwyższonego dostępu.

Trajektoria jest jasna: wspomagane przez AI odkrywanie podatności jest realne, skaluje się, a kwestia zarządzania jest obecnie problemem centralnym. Zdolność modelu została rozwiązana. Scaffold, który orkiestruje odkrywanie, triaż i odpowiedzialne ujawnianie, jeszcze nie.


Źródła

Najczęściej zadawane pytania

Czy mogę korzystać z Claude Mythos przez Claude Code?

Nie. Mythos Preview jest ograniczony do partnerów Projektu Glasswing. Opus 4.7 (16 kwietnia 2026) to najmocniejszy model dostępny przez Claude Code dla ogółu użytkowników; Anthropic stwierdza, że Mythos pozostaje bardziej zaawansowany w obszarze cyber niż jakikolwiek model GA. Tak wyglądała oferta w kwietniu 2026 r. 29 września Anthropic podało, że zweryfikowani obrońcy mogą korzystać z Claude Mythos 5.1 w ramach programów zaufanego dostępu; zob. aktualizację z 1 października powyżej.

Czy zdolności Mythos trafią do Opus?

Opus 4.7 to pierwsze wydanie Opus po Glasswing i posiada zabezpieczenia cyber działające w czasie rzeczywistym. Wzorzec sugeruje, że przyszłe modele Opus będą nosić dodatkowe zabezpieczenia zamiast pełnej koperty możliwości Mythos. Pierwotne ogłoszenie Anthropic stwierdzało, że celem jest „umożliwienie bezpieczniejszego wdrożenia przez nowe zabezpieczenia w przyszłych modelach Claude Opus”.

Jak to się ma do wcześniejszego wpisu o podatnościach?

Prelekcja Carliniego na [un]prompted (omówiona w Gdy Twój agent znajduje podatność) korzystała z Opus 4.6 i znalazła 5 błędów jądra + 22 CVE Firefoksa. Mythos przeskalował to podejście do tysięcy podatności na wszystkich głównych platformach. Metodologia jest ta sama; model jest bardziej zaawansowany.


  1. Claude Mythos Preview — Projekt Glasswing. Anthropic, 7 kwietnia 2026. Oficjalne ogłoszenie. Tysiące znalezionych zero-dayów o wysokiej/krytycznej istotności. 89% wskaźnik potwierdzenia istotności przez profesjonalnych walidatorów. 100 mln USD w kredytach użytkowych. Prowadzone przez Nicholasa Carliniego z ponad 21 współautorami. ↩↩↩↩↩↩↩↩↩↩↩

  2. Projekt Glasswing Anthropic. Simon Willison, 7 kwietnia 2026. Analiza i kontekst modelu ograniczonego wydania oraz wcześniejszych prac Carliniego. ↩

  3. Nicholas Carlini, „Black-hat LLMs”, konferencja bezpieczeństwa AI [un]prompted, kwiecień 2026. Agenda konferencji. Zobacz również: AI Finds Vulns You Can’t, podcast Security Cryptography Whatever. ↩↩

  4. Anthropic twierdzi, że jego najpotężniejszy cybernetyczny model AI jest zbyt niebezpieczny, aby go publicznie udostępnić. VentureBeat, 7 kwietnia 2026. ↩

  5. Aktualizacje popublikacyjne (19 kwietnia 2026). Ogłoszenie Anthropic Przedstawiamy Claude Opus 4.7 (16 kwietnia 2026) pozycjonuje Opus 4.7 jako flagowiec GA, zaznaczając, że Mythos Preview pozostaje bardziej zaawansowany w obszarze cyber. Szczegóły zabezpieczeń cyber w czasie rzeczywistym pod adresem Anthropic Support: Real-time cyber safeguards on Claude. Formularz aplikacyjny Cyber Verification Program aktywny pod adresem claude.com/form/cyber-use-case. ↩↩↩↩

  6. Claude Code CHANGELOG. v2.1.111 dodało obsługę uruchomienia Opus 4.7 (wysiłek xhigh, Auto Mode dla Max bez flagi). v2.1.113 dodało sandbox.network.deniedDomains, reguły odmowy dla poleceń opakowujących, zaostrzenie uprawnień find -exec/-delete oraz ochronę przed usunięciem katalogów /private/{etc,var,tmp,home} w macOS. ↩

  7. Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao i Tripp Gallagher, „GLM-5.3 and the spread of advanced cyber capabilities”, Anthropic Frontier Red Team, 29 września 2026, pobrane 1 października 2026. Cytowane lub zaczerpnięte z wpisu: jego początek o przewadze na starcie, jaką dawał Glasswing, wyniki ExploitBench i eksploatacji plików binarnych (te drugie na 100 losowo wybranych zadaniach), sesja przeglądarkowa z GLM-5.3, sesja N-day z GLM-5.3-Flash, „anyone can download GLM-5.3”, koszt abliteracji i jej wpływ na odsetek odmów wraz z szacunkiem z przypisu 3 dla doświadczonego zespołu, kopie abliterated publicznie dostępne w ciągu kilku dni, przypis 2 o odmowach, odsetki obejść (64%, 92%, 100%) wraz z definicją zaangażowania z rysunku 5 (próba połączenia się z celem; 50 próbek na komórkę) oraz „What does this mean?”. Anthropic zaznacza, że jego symulowane środowisko nie wykonuje kodu wygenerowanego przez model. ↩↩↩↩

  8. NIST Center for AI Standards and Innovation, „CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities”, 17 września 2026, pobrane 1 października 2026: „GLM-5.3 is the most cyber-capable open-weight model released to date”, „GLM-5.3’s cyber capabilities are significantly lower than those of current U.S. frontier models” oraz „lags the capability level of the U.S. frontier by about four months in an aggregate measure of performance across CAISI cyber benchmarks”; uwagi metodologiczne (Methodological Notes) definiują „U.S. frontier best” jako „including both trusted-access releases and full public releases” i stwierdzają: „when applicable, U.S. models were tested with cyber safeguards disabled”. ↩

Powiązane artykuły

Repozytorium nie powinno głosować nad swoim własnym zaufaniem

Dwie luki CVE obchodzące dialog zaufania Claude Code w 37 dni ujawniają błąd kolejności: nie czytaj żadnego bajtu, zanim…

10 min czytania

Serwery MCP to nowa powierzchnia ataku

50 podatności MCP, 30 CVE w 60 dni, 13 krytycznych. Protokoły użycia narzędzi to powierzchnia ataku, której nikt nie aud…

6 min czytania

Pętla Ralph: jak uruchamiam autonomiczne agenty AI na noc

Zbudowałem system autonomicznych agentów z hookami zatrzymania, budżetami spawnowania i pamięcią opartą na plikach. Co z…

9 min czytania