← Todos os Posts

Projeto Glasswing: quando um modelo encontra bugs demais

Do guia: Claude Code Comprehensive Guide

Há duas semanas, Nicholas Carlini mostrou que Claude Code conseguiu encontrar uma vulnerabilidade de 23 anos no kernel do Linux usando um script bash de 10 linhas. Hoje, Anthropic anunciou o que aconteceu quando essa abordagem foi escalada: um novo modelo chamado Claude Mythos, que encontrou milhares de vulnerabilidades zero-day de severidade alta e crítica, e então decidiu não liberá-lo publicamente.1

O Projeto Glasswing é a implantação restrita pela Anthropic do Claude Mythos, um modelo de fronteira que descobriu milhares de vulnerabilidades zero-day em todos os principais sistemas operacionais e navegadores web. O Mythos encontrou bugs críticos, incluindo uma falha TCP SACK de 27 anos no OpenBSD e uma vulnerabilidade de execução remota de código em NFS no FreeBSD. A Anthropic restringiu o acesso a 12 organizações parceiras apenas para segurança defensiva, comprometeu US$ 100 milhões em créditos de uso e abriu o formulário de inscrição do Cyber Verification Program em claude.com/form/cyber-use-case para pesquisadores qualificados.

O Projeto Glasswing é a resposta da Anthropic à pergunta que os profissionais vêm fazendo desde a palestra de Carlini no [un]prompted: o que acontece quando essa capacidade é implantada em escala? A resposta: você restringe.

TL;DR

O Claude Mythos Preview é um modelo de fronteira cujas capacidades de cibersegurança, segundo a Anthropic, “emergiram como consequência posterior de melhorias gerais em código, raciocínio e autonomia.”1 A Anthropic o posiciona como mais capaz em cibersegurança do que qualquer modelo Opus geralmente disponível (incluindo o lançamento do Opus 4.7 em 16 de abril de 2026), e restringe o acesso a 12 organizações parceiras (Apple, Amazon, Microsoft, Google, Linux Foundation e outras) apenas para trabalho de segurança defensiva. O modelo encontrou milhares de zero-days, incluindo um bug TCP SACK de 27 anos no OpenBSD, uma vulnerabilidade de 16 anos no FFmpeg e uma RCE em NFS no FreeBSD (CVE-2026-4747).1 A Anthropic comprometeu US$ 100 milhões em créditos de uso e US$ 4 milhões para organizações de segurança open-source. O formulário de inscrição do Cyber Verification Program está no ar para pesquisadores de segurança legítimos que buscam acesso.1 A atualização de 1º de outubro de 2026, mais abaixo, trata do GLM-5.3, um modelo de pesos abertos que, segundo a Anthropic, desenvolve exploits de ponta a ponta para bugs conhecidos do V8 a uma taxa próxima à do Mythos Preview no ExploitBench.7

Pontos-chave

  • Engenheiros de segurança: o limiar de capacidade que Carlini demonstrou no [un]prompted é real, e escala. O Mythos encontrou vulnerabilidades em “todos os principais sistemas operacionais e navegadores web.”2 Equipes de segurança defensiva das 12 organizações parceiras agora têm acesso. Todos os outros deveriam estar se preparando para o que vem quando essas capacidades chegarem a modelos geralmente disponíveis. (Em setembro de 2026, a Anthropic já relatava um modelo de pesos abertos com taxa próxima à do Mythos Preview no ExploitBench, 50 contra 56 de 410 tentativas; veja a atualização de 1º de outubro.)
  • Construtores de scaffolds: o Mythos roda via Claude Code em containers isolados.1 O padrão de scaffold (agente CLI + execução em sandbox + triagem automatizada) agora serve como a arquitetura de produção para pesquisa de segurança de fronteira na própria Anthropic. Os padrões de orquestração que os profissionais construíram de forma independente se sustentam no mais alto nível.
  • Todos os outros: a Anthropic escolheu restrição em vez de liberação. Essa é uma decisão de governança real, com tradeoffs reais. O modelo existe. A Anthropic demonstrou as capacidades. A pergunta não é mais se a IA pode encontrar zero-days, mas sim quem terá acesso e sob quais restrições.

Atualização (1º de outubro de 2026): a capacidade chegou aos pesos abertos

No relato da própria Anthropic, o Glasswing foi uma aposta em vantagem inicial: restringir o modelo, deixar os defensores usarem primeiro e contar com que a capacidade se espalharia de qualquer forma. Em 29 de setembro, o Frontier Red Team da Anthropic disse que essa difusão aconteceu: “those models have now arrived” (esses modelos chegaram).7 O GLM-5.3, um modelo de pesos abertos da Zhipu AI (Z.ai), “develops end-to-end exploits in 50 of 410 attempts” (desenvolve exploits de ponta a ponta em 50 de 410 tentativas) no ExploitBench, um conjunto de vulnerabilidades conhecidas do V8, onde o Claude Mythos Preview “did so at a similar rate” (fez isso a uma taxa semelhante), 56 de 410. Em 100 tarefas selecionadas aleatoriamente do benchmark interno de exploração de binários da Anthropic, ele conseguiu um sequestro completo do fluxo de controle em 4% das tentativas, contra 6% do Mythos Preview, e “earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them” (modelos anteriores, como o Claude Opus 4.6 e o GLM-5.2, não têm sucesso em nenhuma delas). O CAISI do NIST, em sua própria avaliação, chamou o GLM-5.3 em 17 de setembro de “the most cyber-capable open-weight model released to date” (o modelo de pesos abertos com maior capacidade cibernética lançado até hoje), mas concluiu que suas capacidades são “significantly lower than those of current U.S. frontier models” (significativamente inferiores às dos atuais modelos de fronteira dos EUA) e estão “about four months” (cerca de quatro meses) atrás deles; pelas notas do CAISI, essa fronteira inclui lançamentos de acesso confiável além dos públicos, e os modelos dos EUA foram testados com as salvaguardas cibernéticas desativadas quando aplicável.8

A parte que importa para este post são as salvaguardas. As tarefas de desenvolvimento de exploits acima não acionaram as recusas do modelo lançado em momento algum; os números a seguir tratam de pedidos abertamente maliciosos. Nos testes simulados da Anthropic, o GLM-5.3 recusou todos os pedidos diretos e abertamente maliciosos; uma história de fachada o levou a se engajar, ou seja, a tentar se conectar ao alvo simulado, em 64% das vezes, o raciocínio pré-preenchido em 92% e uma cópia abliterated (editada para parar de recusar) em 100%. Essa edição, que derrubou as recusas em três benchmarks públicos de mais de 90% para entre 2% e 12%, custou à equipe da Anthropic, que nunca a tinha feito antes, “about 2,200 GPU hours at a computation cost of roughly $4,400” (cerca de 2.200 horas de GPU, a um custo computacional de aproximadamente $4,400); a Anthropic estima que uma equipe experiente precisaria de cerca de $1,200, e observa que cópias abliterated ficaram públicas poucos dias após o lançamento. Os pesos são públicos: “anyone can download GLM-5.3” (qualquer pessoa pode baixar o GLM-5.3). Uma sessão mostra o preço. Um pesquisador deu ao GLM-5.3-Flash, o modelo menor, os detalhes públicos de uma falha do Chrome divulgada recentemente e de mais uma, e ele “chained together exploits for these two flaws, building a reliable exploit chain for an ARM64 target” (encadeou exploits para essas duas falhas, construindo uma cadeia de exploração confiável para um alvo ARM64), com “20 minutes of human attention, plus eight hours of work” (20 minutos de atenção humana, mais oito horas de trabalho) do modelo. O preço disso, segundo a Anthropic: “At Zhipu’s API prices, this effort would have cost $20.40” (pelos preços da API da Zhipu, esse esforço teria custado $20.40).7

O que isso faz com o argumento abaixo. A restrição comprou uma vantagem inicial, não exclusividade. Nas palavras da Anthropic: “a critical threshold in freely accessible capabilities has now been crossed” (um limiar crítico nas capacidades de livre acesso foi ultrapassado). O conselho para os profissionais fica mais urgente, não diferente. A camada de triagem, o fluxo de divulgação e a cadência de patches carregam o peso agora, porque o desenvolvimento de exploits a uma taxa próxima à do Mythos Preview no ExploitBench e, em uma sessão separada de um pesquisador com o GLM-5.3 completo, a descoberta e o encadeamento de vulnerabilidades até então desconhecidas em um navegador web agora vêm como um download. Os resultados do Opus 4.6 na busca por bugs, descritos abaixo, continuam valendo; nas mesmas 100 tarefas selecionadas aleatoriamente do benchmark de exploração de binários da Anthropic, ele não conseguiu nenhum sequestro completo do fluxo de controle. O mesmo post observa que defensores verificados “can now use even more advanced models like Claude Mythos 5.1 through our trusted access programs” (agora podem usar modelos ainda mais avançados, como o Claude Mythos 5.1, por meio dos nossos programas de acesso confiável), então o acesso restrito também avançou. Se esses programas são o caminho de inscrição que este post descreve, o post da Anthropic não diz.7 Os nomes de modelos nas seções abaixo são os de abril; leia-os com essa data em mente.


Atualização (19 de abril de 2026)

Desde que este post foi publicado em 7 de abril, duas coisas mudaram:

  1. O Opus 4.7 foi lançado em 16 de abril de 2026 como o novo modelo principal geralmente disponível. A Anthropic afirma que o Opus 4.7 é deliberadamente menos capaz em cibersegurança do que o Mythos Preview e vem com salvaguardas cibernéticas em tempo real. O Mythos Preview permanece separado e restrito.5
  2. O formulário de inscrição do Cyber Verification Program está no ar em claude.com/form/cyber-use-case. O que o anúncio original chamou de programa “futuro” agora é um caminho de inscrição concreto.5
  3. Claude Code lançou dois releases de infraestrutura relevantes: v2.1.111 adicionou suporte a Opus 4.7 / xhigh / Auto Mode; v2.1.113 adicionou sandbox.network.deniedDomains, regras de deny para wrapper-command (env / sudo / watch / ionice / setsid), tratamento mais rigoroso de find -exec / -delete e proteção contra remoção em /private/{etc,var,tmp,home} no macOS sob Bash(rm:*).6 Essas são exatamente as primitivas de hardening que um scaffold de pesquisa de segurança estilo Mythos precisa.

O argumento central abaixo — restrição de capacidade em vez de liberação, padrões de scaffold se sustentando no mais alto nível, todos os outros se preparando para o que vem quando esses recursos chegarem ao GA — permanece inalterado. Inclusive, o enquadramento explícito de salvaguardas cibernéticas do Opus 4.7 o fortalece.


Da palestra ao produto

A palestra de Carlini no [un]prompted no início de abril foi a prévia pública.3 Ele mostrou cinco vulnerabilidades no kernel do Linux e 22 CVEs no Firefox encontradas com um script simples de iteração de arquivos. O gargalo, disse ele, era a validação humana — “várias centenas de crashes que ainda não validei.”

O Mythos é o que acontece quando você remove esse gargalo com um modelo mais capaz e infraestrutura dedicada. A diferença de escala é significativa:1

Métrica Palestra de Carlini Projeto Glasswing
Vulnerabilidades encontradas 5 no kernel + 22 CVEs no Firefox Milhares em todas as principais plataformas
Alvos Kernel do Linux, Firefox Todos os principais sistemas operacionais, navegadores, projetos open-source
Validação Manual, conduzida pelo pesquisador Contratados profissionais de segurança, 89% de confirmação de severidade
Acesso Opus 4.6 na época da palestra de Carlini; Opus 4.7 agora é o modelo principal GA Mythos Preview (restrito a 12 parceiros)

O número da validação profissional importa: 89% dos 198 relatórios revisados tiveram avaliações de severidade confirmadas por contratados independentes de segurança, com 98% dentro de um nível de severidade.1 Essas não são descobertas alucinadas.

A decisão de restringir

A posição declarada da Anthropic: “Não planejamos disponibilizar o Claude Mythos Preview de forma geral devido às suas capacidades de cibersegurança.”4

A decisão chama a atenção. Empresas de modelos normalmente correm para liberar capacidades. A Anthropic construiu um modelo demonstravelmente melhor em encontrar vulnerabilidades do que qualquer sistema publicamente disponível, e então escolheu restringi-lo ao uso defensivo por parceiros avaliados. O compromisso de US$ 100 milhões em créditos de uso sinaliza que isso não é um exercício de marketing.1

O modelo de restrição tem três níveis:1 1. Parceiros do Projeto Glasswing (12 organizações): acesso direto para segurança defensiva 2. Acesso mais amplo (40 organizações no total): implantação supervisionada 3. Cyber Verification Program (agora no ar em claude.com/form/cyber-use-case): caminho de inscrição para profissionais de segurança verificados5

Para os profissionais, o API padrão e o Claude Code não expõem as capacidades de descoberta de vulnerabilidades do Mythos. O modelo mais forte geralmente disponível agora é o Opus 4.7 (lançado em 16 de abril de 2026), que a Anthropic posiciona como deliberadamente menos capaz em cibersegurança do que o Mythos e vem com salvaguardas cibernéticas em tempo real.5 As capacidades demonstradas pelo Mythos já influenciaram esse lançamento de 16 de abril — o Opus 4.7 é o primeiro modelo pós-Glasswing da Anthropic com salvaguardas cibernéticas dedicadas.

O que isso valida

O Projeto Glasswing valida vários padrões que a comunidade de profissionais construiu de forma independente:

Claude Code como scaffold de execução. O Mythos roda via Claude Code em containers isolados.1 O mesmo agente CLI que os profissionais usam para codar diariamente serve como camada de execução para pesquisa de segurança de fronteira. Os hooks, skills e sandboxing que o Claude Code oferece não são recursos de conveniência. São a infraestrutura que torna a varredura autônoma de segurança segura o suficiente para implantar.

O gargalo de verificação é um problema de orquestração. A palestra de Carlini identificou a validação humana como o gargalo. A solução do Projeto Glasswing: contratados profissionais de segurança para validação, commitments de hash SHA-3 para divulgação responsável e infraestrutura estruturada de triagem.1 O mesmo problema de triagem apareceu em Quando seu agente encontra uma vulnerabilidade, e a solução é infraestrutura, não capacidade do modelo.

Hooks de governança importam mais do que capacidade de varredura. O modelo consegue encontrar as vulnerabilidades. O problema difícil é controlar a divulgação, gerenciar o acesso e garantir que as descobertas cheguem aos defensores antes dos atacantes. A resposta da Anthropic é organizacional (restringir o modelo, avaliar os parceiros, comprometer recursos). Para profissionais construindo sua própria varredura de segurança, os hooks de governança que regulam a saída são o equivalente.

O que isso significa para os profissionais

Você não terá acesso ao Mythos. Aqui está o que você pode fazer com o que tem:

O Opus 4.6 já é capaz. Os resultados de Carlini no [un]prompted (5 bugs no kernel, 22 CVEs no Firefox) usaram o Opus 4.6, não o Mythos.3 A metodologia capture-the-flag, os builds instrumentados com ASAN e o script de iteração de arquivos são todos reproduzíveis com o modelo geralmente disponível.

Construa a camada de triagem agora. Quando modelos Opus futuros herdarem algumas das capacidades do Mythos (como a Anthropic sugeriu), o gargalo será o mesmo que Carlini identificou: validação humana. As equipes que tiverem deduplicação automatizada, classificação de severidade e fluxos de divulgação prontos serão as primeiras a se beneficiar.

Inscreva-se no Cyber Verification Program. O formulário de inscrição está no ar em claude.com/form/cyber-use-case. Se você faz pesquisa legítima de segurança, esse é o caminho para acesso elevado.

A trajetória está clara: a descoberta de vulnerabilidades assistida por IA é real, escala, e a questão de governança agora é o problema central. A capacidade do modelo está resolvida. O scaffold que orquestra descoberta, triagem e divulgação responsável, não.


Fontes

Perguntas frequentes

Posso usar o Claude Mythos através do Claude Code?

Não. O Mythos Preview é restrito aos parceiros do Projeto Glasswing. O Opus 4.7 (16 de abril de 2026) é o modelo mais forte disponível através do Claude Code para usuários gerais; a Anthropic afirma que o Mythos continua mais capaz em cibersegurança do que qualquer modelo GA. Esse era o quadro em abril de 2026. Em 29 de setembro, a Anthropic disse que defensores verificados podiam usar o Claude Mythos 5.1 por meio dos seus programas de acesso confiável; veja a atualização de 1º de outubro acima.

As capacidades do Mythos chegarão ao Opus?

O Opus 4.7 é o primeiro lançamento Opus pós-Glasswing da Anthropic e vem com salvaguardas cibernéticas em tempo real. O padrão sugere que modelos Opus futuros carregarão salvaguardas adicionais em vez do envelope completo de capacidades do Mythos. O anúncio original da Anthropic afirmou que o objetivo é “permitir uma implantação mais segura através de novas salvaguardas em modelos Claude Opus futuros.”

Como isso se relaciona com o post anterior sobre vulnerabilidades?

A palestra de Carlini no [un]prompted (coberta em Quando seu agente encontra uma vulnerabilidade) usou o Opus 4.6 e encontrou 5 bugs no kernel + 22 CVEs no Firefox. O Mythos escalou essa abordagem para milhares de vulnerabilidades em todas as principais plataformas. A metodologia é a mesma; o modelo é mais capaz.


  1. Claude Mythos Preview — Project Glasswing. Anthropic, 7 de abril de 2026. Anúncio oficial. Milhares de zero-days de severidade alta/crítica encontrados. Taxa de confirmação de severidade de 89% por validadores profissionais. US$ 100 milhões em créditos de uso. Liderado por Nicholas Carlini com mais de 21 coautores. ↩↩↩↩↩↩↩↩↩↩↩

  2. Anthropic’s Project Glasswing. Simon Willison, 7 de abril de 2026. Análise e contexto sobre o modelo de lançamento restrito e o trabalho anterior de Carlini. ↩

  3. Nicholas Carlini, “Black-hat LLMs,” conferência de segurança [un]prompted AI, abril de 2026. Agenda da conferência. Veja também: AI Finds Vulns You Can’t, podcast Security Cryptography Whatever. ↩↩

  4. Anthropic says its most powerful AI cyber model is too dangerous to release publicly. VentureBeat, 7 de abril de 2026. ↩

  5. Atualizações pós-publicação (19 de abril de 2026). O anúncio da Anthropic Introducing Claude Opus 4.7 (16 de abril de 2026) posiciona o Opus 4.7 como o modelo principal GA enquanto observa que o Mythos Preview continua mais capaz em cibersegurança. Detalhes das salvaguardas cibernéticas em tempo real em Anthropic Support: Real-time cyber safeguards on Claude. Formulário de inscrição do Cyber Verification Program no ar em claude.com/form/cyber-use-case. ↩↩↩↩

  6. Claude Code CHANGELOG. v2.1.111 adicionou suporte ao lançamento do Opus 4.7 (esforço xhigh, Auto Mode para Max sem flag). v2.1.113 adicionou sandbox.network.deniedDomains, regras de deny para wrapper-command, endurecimento de permissões para find -exec/-delete e proteção contra remoção em /private/{etc,var,tmp,home} no macOS. ↩

  7. Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao e Tripp Gallagher, “GLM-5.3 and the spread of advanced cyber capabilities”, Anthropic Frontier Red Team, 29 de setembro de 2026, consultado em 1º de outubro de 2026. Citado ou extraído do post: a abertura sobre a vantagem inicial do Glasswing, os resultados do ExploitBench e de exploração de binários (estes em 100 tarefas selecionadas aleatoriamente), a sessão de navegador com o GLM-5.3, a sessão de N-day com o GLM-5.3-Flash, “anyone can download GLM-5.3”, o custo da abliteração e seu efeito nas taxas de recusa, com a estimativa da nota de rodapé 3 para uma equipe experiente, as cópias abliterated públicas em poucos dias, a nota de rodapé 2 sobre recusas, as taxas de contorno (64%, 92%, 100%) com a definição de engajamento da Figura 5 (tentou se conectar ao alvo; 50 amostras por célula) e “What does this mean?”. A Anthropic observa que seu ambiente simulado não executa nenhum código gerado pelo modelo. ↩↩↩↩

  8. NIST Center for AI Standards and Innovation, “CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities”, 17 de setembro de 2026, consultado em 1º de outubro de 2026: “GLM-5.3 is the most cyber-capable open-weight model released to date”, “GLM-5.3’s cyber capabilities are significantly lower than those of current U.S. frontier models” e “lags the capability level of the U.S. frontier by about four months in an aggregate measure of performance across CAISI cyber benchmarks”; as Methodological Notes (notas metodológicas) definem “U.S. frontier best” como “including both trusted-access releases and full public releases” e dizem “when applicable, U.S. models were tested with cyber safeguards disabled.” ↩

Artigos relacionados

O Repo Não Deveria Ter Voto na Própria Confiança

Dois CVEs de bypass do diálogo de confiança do Claude Code em 37 dias: não interprete bytes do workspace antes de confia…

11 min de leitura

Servidores MCP são a nova superfície de ataque

50 vulnerabilidades MCP, 30 CVEs em 60 dias, 13 críticas: a superfície de ataque que ninguém audita, com taxonomia e cor…

7 min de leitura

O Ralph Loop: Como Executo Agentes de IA Autônomos Durante a Noite

Construí um sistema de agentes autônomos com stop hooks, orçamentos de spawn e memória em sistema de arquivos. As falhas…

10 min de leitura