Project Glasswing: 모델이 너무 많은 버그를 찾을 때
2주 전, Nicholas Carlini는 Claude Code가 단 10줄짜리 bash 스크립트로 23년 된 Linux 커널 취약점을 찾아낼 수 있음을 보였습니다. 오늘 Anthropic는 그 접근 방식을 확장했을 때 어떤 일이 벌어졌는지 발표했습니다. Claude Mythos라 불리는 새 모델이 모든 주요 운영체제와 웹 브라우저에 걸쳐 높음 및 중대 심각도의 제로데이 취약점 수천 개를 찾아냈고, Anthropic는 이를 공개적으로 배포하지 않기로 결정했다는 것입니다.1
Project Glasswing은 Anthropic가 Claude Mythos의 배포를 제한한 조치로, Mythos는 모든 주요 운영체제와 웹 브라우저 전반에 걸쳐 수천 개의 제로데이 취약점을 발견한 프런티어 모델입니다. Mythos는 27년 된 OpenBSD TCP SACK 결함, FreeBSD NFS 원격 코드 실행 취약점 등 중대한 버그들을 찾아냈습니다. Anthropic는 오직 방어적 보안 목적으로만 12개 파트너 조직에게 접근 권한을 제한했고, 1억 달러 규모의 사용 크레딧을 약정했으며, 자격을 갖춘 연구자들을 위해 claude.com/form/cyber-use-case에서 Cyber Verification Program 신청 양식을 개설했습니다.
Project Glasswing은 Carlini의 [un]prompted 발표 이후 실무자들이 계속 던져온 질문에 대한 Anthropic의 답입니다. 이 역량이 대규모로 배포되면 어떤 일이 벌어지는가? 답은 이렇습니다. 접근을 제한한다는 것입니다.
TL;DR
Claude Mythos Preview는 프런티어 모델로, Anthropic에 따르면 그 사이버보안 역량은 “코드, 추론, 자율성 전반의 일반적 개선의 하류 결과로 출현했다”고 합니다.1 Anthropic는 이 모델을 (2026년 4월 16일 출시된 Opus 4.7을 포함한) 일반적으로 사용 가능한 어떤 Opus 모델보다도 사이버 역량이 뛰어난 모델로 자리매김하며, Apple, Amazon, Microsoft, Google, Linux Foundation 등 12개 파트너 조직에만 방어적 보안 업무용으로 접근을 제한하고 있습니다. 이 모델은 27년 된 OpenBSD TCP SACK 버그, 16년 된 FFmpeg 취약점, FreeBSD NFS RCE(CVE-2026-4747)를 포함해 수천 개의 제로데이를 찾아냈습니다.1 Anthropic는 1억 달러의 사용 크레딧과 오픈소스 보안 조직에 400만 달러를 약정했습니다. Cyber Verification Program 신청 양식은 접근을 희망하는 정식 보안 연구자를 위해 현재 가동 중입니다.1 아래의 2026년 10월 1일 업데이트는 GLM-5.3을 다룹니다. Anthropic의 보고에 따르면 이 오픈 웨이트 모델은 알려진 V8 버그에 대한 엔드투엔드 익스플로잇을 ExploitBench에서 Mythos Preview와 비슷한 비율로 개발합니다.7
핵심 요약
- 보안 엔지니어: Carlini가 [un]prompted에서 시연한 역량 임계값은 실재하며, 확장 가능합니다. Mythos는 “모든 주요 운영체제와 웹 브라우저”에서 취약점을 찾아냈습니다.2 12개 파트너 조직의 방어 보안 팀은 이제 접근 권한을 갖고 있습니다. 나머지 모두는 이 역량이 일반적으로 사용 가능한 모델에 도달할 때를 대비해야 합니다. (2026년 9월까지 Anthropic은 ExploitBench에서 Mythos Preview와 비슷한 비율을 보인 오픈 웨이트 모델을 보고했습니다. 410회 시도 중 50회 대 56회입니다. 10월 1일 업데이트를 참고하세요.)
- 스캐폴드 빌더: Mythos는 격리된 컨테이너 안에서 Claude Code를 통해 실행됩니다.1 스캐폴드 패턴(에이전트 CLI + 샌드박스 실행 + 자동 분류)은 이제 Anthropic 자체의 프런티어 보안 연구를 위한 프로덕션 아키텍처 역할을 하고 있습니다. 실무자들이 독자적으로 구축한 오케스트레이션 패턴은 최상위 수준에서도 통합니다.
- 그 밖의 모두: Anthropic는 공개 대신 제한을 선택했습니다. 이는 실질적 트레이드오프를 수반하는 실질적 거버넌스 결정입니다. 모델은 존재합니다. Anthropic는 그 역량을 입증했습니다. 질문은 더 이상 AI가 제로데이를 찾을 수 있는가가 아니라, 누가 어떤 제약 아래에서 접근 권한을 얻느냐입니다.
업데이트 (2026년 10월 1일): 역량이 오픈 웨이트에 도달하다
Anthropic 스스로의 회고에서 Glasswing은 시간을 버는 데 건 내기였습니다. 모델을 제한하고, 방어자가 먼저 쓰게 하고, 그래도 역량은 결국 퍼질 것이라고 예상하는 것입니다. 9월 29일 Anthropic의 Frontier Red Team은 그 확산이 일어났다고 밝혔습니다. “those models have now arrived”(그런 모델들이 이제 도착했다).7 Zhipu AI(Z.ai)의 오픈 웨이트 모델인 GLM-5.3은 알려진 V8 취약점들로 구성된 ExploitBench에서 “develops end-to-end exploits in 50 of 410 attempts”(410회 시도 중 50회에서 엔드투엔드 익스플로잇을 개발한다)였고, Claude Mythos Preview는 “did so at a similar rate”(비슷한 비율로 해냈다), 즉 410회 중 56회였습니다. Anthropic 내부의 바이너리 익스플로잇 벤치마크에서 무작위로 고른 100개 과제에서는 완전한 제어 흐름 탈취에 이른 시행이 GLM-5.3은 4%, Mythos Preview는 6%였고, “earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them”(Claude Opus 4.6과 GLM-5.2 같은 이전 모델은 어느 과제에서도 성공하지 못한다)이라고 합니다. NIST의 CAISI는 자체 평가에서 9월 17일 GLM-5.3을 “the most cyber-capable open-weight model released to date”(지금까지 공개된 오픈 웨이트 모델 중 사이버 역량이 가장 높은 모델)라고 불렀습니다. 동시에 그 역량이 “significantly lower than those of current U.S. frontier models”(현재 미국 프런티어 모델보다 상당히 낮다)이며 “about four months”(약 4개월) 뒤처져 있다고 판단했습니다. CAISI의 주석에 따르면 이 프런티어에는 공개 출시 모델뿐 아니라 신뢰 기반 접근용 출시 모델도 포함되며, 미국 모델들은 해당하는 경우 사이버 세이프가드를 끈 상태로 시험되었습니다.8
이 글과 관련된 부분은 세이프가드입니다. 위의 익스플로잇 개발 과제들은 출시된 모델의 거부를 전혀 일으키지 않았습니다. 이어지는 수치는 노골적으로 악의적인 요청을 대상으로 한 것입니다. Anthropic의 시뮬레이션 테스트에서 GLM-5.3은 직접적이고 노골적으로 악의적인 요청을 모두 거부했습니다. 그러나 그럴듯한 핑계를 대면 64%의 비율로 응했고(여기서 응한다는 것은 시뮬레이션된 표적에 연결을 시도한다는 뜻입니다), 추론 앞부분을 미리 채워 두면 92%, abliterated 사본(거부하지 않도록 편집한 사본)은 100%였습니다. 이 편집으로 세 개의 공개 벤치마크에서 거부율이 90% 이상에서 2%에서 12% 사이로 떨어졌습니다. 이 작업을 해 본 적이 없던 Anthropic 팀에게 그 비용은 “about 2,200 GPU hours at a computation cost of roughly $4,400”(약 2,200 GPU 시간, 연산 비용으로 약 $4,400)이었습니다. Anthropic은 숙련된 팀이라면 약 $1,200면 될 것으로 추정하며, abliterated 사본이 출시 며칠 만에 공개되었다는 점도 적고 있습니다. 가중치는 공개되어 있습니다. “anyone can download GLM-5.3”(누구나 GLM-5.3을 내려받을 수 있다). 한 세션이 그 대가가 얼마나 작은지를 보여 줍니다. 한 연구자가 더 작은 GLM-5.3-Flash에 최근 공개된 Chrome 결함 하나와 또 다른 결함 하나의 공개 정보를 주자, 모델은 “chained together exploits for these two flaws, building a reliable exploit chain for an ARM64 target”(이 두 결함의 익스플로잇을 엮어 ARM64 표적을 위한 신뢰할 수 있는 익스플로잇 체인을 만들었다)고 합니다. 든 것은 “20 minutes of human attention, plus eight hours of work”(사람이 주의를 기울인 20분, 그리고 8시간의 작업)였고, 그 작업은 모델이 했습니다. 이에 대해 Anthropic이 매긴 비용은 “At Zhipu’s API prices, this effort would have cost $20.40.”(Zhipu의 API 가격이라면 이 작업에 $20.40가 들었을 것이다)입니다.7
이것이 아래의 논지에 미치는 영향은 이렇습니다. 제한이 사 준 것은 앞선 출발이지 독점이 아니었습니다. Anthropic의 표현으로는 “a critical threshold in freely accessible capabilities has now been crossed”(자유롭게 접근 가능한 역량이 이제 결정적인 임계점을 넘어섰다)입니다. 실무자를 위한 조언은 달라지는 것이 아니라 더 시급해집니다. 이제 무게를 짊어지는 것은 트리아지 계층, 공개 워크플로, 그리고 패치 주기입니다. Mythos Preview의 ExploitBench 비율에 근접한 익스플로잇 개발이, 그리고 전체 GLM-5.3을 사용한 별도의 연구자 세션에서는 웹 브라우저에서 이전에 알려지지 않았던 취약점을 발견하고 엮어 내는 일까지도, 이제는 다운로드로 손에 들어오기 때문입니다. 아래에 나오는 Opus 4.6의 버그 발견 결과는 여전히 유효합니다. Anthropic의 바이너리 익스플로잇 벤치마크에서 무작위로 고른 같은 100개 과제에서 Opus 4.6은 완전한 제어 흐름 탈취에 한 번도 이르지 못했습니다. 같은 글은 검증된 방어자가 “can now use even more advanced models like Claude Mythos 5.1 through our trusted access programs”(신뢰 기반 접근 프로그램을 통해 Claude Mythos 5.1 같은 더 발전된 모델도 이제 사용할 수 있다)라고 밝히고 있어, 제한된 접근 쪽도 앞으로 나아갔습니다. 그 프로그램들이 이 글에서 설명하는 신청 경로인지는 Anthropic의 글에 나와 있지 않습니다.7 아래 섹션들에 나오는 모델 이름은 4월 기준입니다. 그 날짜를 염두에 두고 읽으세요.
업데이트 (2026년 4월 19일)
이 글이 4월 7일에 게시된 이후 두 가지 변화가 있었습니다.
- Opus 4.7이 2026년 4월 16일에 출시되어 새로운 일반 출시(GA) 플래그십이 되었습니다. Anthropic는 Opus 4.7이 Mythos Preview보다 의도적으로 덜 사이버 역량을 갖도록 설계되었으며, 실시간 사이버 세이프가드와 함께 출시된다고 밝혔습니다. Mythos Preview는 여전히 분리된 상태로 접근이 제한됩니다.5
- Cyber Verification Program 신청 양식이 현재 가동 중이며 claude.com/form/cyber-use-case에서 접근할 수 있습니다. 원래 발표에서 “미래”의 프로그램이라 불렸던 것이 이제는 구체적인 신청 경로가 되었습니다.5
- Claude Code는 관련된 두 가지 인프라 릴리스를 출시했습니다. v2.1.111은 Opus 4.7 / xhigh / Auto Mode 지원을 추가했습니다. v2.1.113은
sandbox.network.deniedDomains, 래퍼 명령 거부 규칙(env / sudo / watch / ionice / setsid), 더 엄격해진find -exec/-delete처리, 그리고Bash(rm:*)아래에서의 macOS/private/{etc,var,tmp,home}제거 보호를 추가했습니다.6 이들은 정확히 Mythos 스타일의 보안 연구 스캐폴드가 필요로 하는 종류의 강화 기본 요소들입니다.
아래에서 이어지는 핵심 논지 — 공개보다 역량 제한, 최고 수준에서도 유효한 스캐폴드 패턴, GA 도달 시점을 대비해야 하는 나머지 모두 — 는 바뀌지 않았습니다. 오히려 Opus 4.7의 명시적인 사이버 세이프가드 프레이밍이 이를 강화합니다.
발표에서 제품까지
Carlini의 4월 초 [un]prompted 발표는 공개 예고편이었습니다.3 그는 간단한 파일 순회 스크립트로 찾아낸 5개의 Linux 커널 취약점과 22개의 Firefox CVE를 보여주었습니다. 그는 병목이 사람의 검증이라고 말했습니다. “아직 검증하지 못한 크래시가 수백 개 있다”고요.
Mythos는 더 강력한 모델과 전용 인프라로 그 병목을 제거했을 때 벌어지는 일입니다. 규모 차이는 상당합니다.1
| 지표 | Carlini의 발표 | Project Glasswing |
|---|---|---|
| 발견된 취약점 | 커널 5개 + Firefox CVE 22개 | 모든 주요 플랫폼에 걸쳐 수천 개 |
| 대상 | Linux 커널, Firefox | 모든 주요 OS, 브라우저, 오픈소스 프로젝트 |
| 검증 | 수동, 연구자 주도 | 전문 보안 계약 업체, 89% 심각도 확인 |
| 접근 | Carlini 발표 당시 Opus 4.6, 현재 GA 플래그십은 Opus 4.7 | Mythos Preview (12개 파트너로 제한) |
전문 검증 수치는 중요합니다. 검토된 198개 보고서 중 89%에서 독립 보안 계약 업체가 심각도 평가를 확인했으며, 98%는 한 심각도 등급 이내로 일치했습니다.1 환각이 만들어낸 결과물이 아닙니다.
제한 결정
Anthropic의 공식 입장은 이렇습니다. “사이버보안 역량을 이유로 Claude Mythos Preview를 일반적으로 사용 가능하게 만들 계획은 없습니다.”4
이 결정은 돋보입니다. 모델 회사들은 통상 역량을 먼저 출시하려 경쟁합니다. Anthropic는 공개 가능한 어떤 시스템보다도 취약점 발견에 명백히 뛰어난 모델을 만들고 나서, 검증된 파트너의 방어적 사용으로만 접근을 제한하기로 선택했습니다. 1억 달러 사용 크레딧 약정은 이것이 마케팅 행사가 아님을 시사합니다.1
제한 모델은 세 단계로 구성됩니다.1 1. Project Glasswing 파트너 (12개 조직): 방어적 보안을 위한 직접 접근 2. 확장 접근 (총 40개 조직): 감독 하 배포 3. Cyber Verification Program (현재 claude.com/form/cyber-use-case에서 가동 중): 검증된 보안 전문가를 위한 신청 경로5
실무자에게 표준 API와 Claude Code는 Mythos의 취약점 발견 역량을 노출하지 않습니다. 현재 일반적으로 사용 가능한 가장 강력한 모델은 Opus 4.7(2026년 4월 16일 출시)이며, Anthropic는 이를 Mythos보다 의도적으로 덜 사이버 역량을 갖도록 하고 실시간 사이버 세이프가드와 함께 출시한다고 설명합니다.5 Mythos가 입증한 역량은 이미 이 4월 16일 릴리스에 영향을 미쳤습니다. Opus 4.7은 Anthropic의 Glasswing 이후 첫 모델이며 전용 사이버 세이프가드를 갖추고 있습니다.
이것이 검증하는 것
Project Glasswing은 실무자 커뮤니티가 독자적으로 구축해온 여러 패턴을 검증합니다.
실행 스캐폴드로서의 Claude Code. Mythos는 격리된 컨테이너에서 Claude Code를 통해 실행됩니다.1 실무자들이 매일의 코딩에 사용하는 바로 그 에이전트 CLI가 프런티어 보안 연구의 실행 계층 역할을 합니다. Claude Code가 제공하는 hooks, skills, 샌드박싱은 편의 기능이 아닙니다. 자율적 보안 스캐닝을 배포 가능할 만큼 안전하게 만드는 인프라입니다.
검증 병목은 오케스트레이션 문제입니다. Carlini의 발표는 사람 검증을 병목으로 지목했습니다. Project Glasswing의 해법은 검증을 위한 전문 보안 계약 업체, 책임 있는 공개를 위한 SHA-3 해시 커밋먼트, 그리고 구조화된 분류 인프라입니다.1 동일한 분류 문제가 When Your Agent Finds a Vulnerability에서도 부상했으며, 해법은 모델 역량이 아니라 인프라입니다.
거버넌스 hooks가 스캐닝 역량보다 더 중요합니다. 모델은 취약점을 찾을 수 있습니다. 어려운 문제는 공개를 통제하고, 접근을 관리하며, 발견 사항이 공격자보다 방어자에게 먼저 도달하도록 보장하는 일입니다. Anthropic의 답은 조직적입니다(모델을 제한하고, 파트너를 검증하며, 자원을 약정). 자체 보안 스캐닝을 구축하는 실무자에게는 출력을 게이트하는 거버넌스 hooks가 그 등가물입니다.
이것이 실무자에게 의미하는 바
여러분은 Mythos 접근 권한을 얻지 못할 것입니다. 현재 가진 것으로 할 수 있는 일은 다음과 같습니다.
Opus 4.6는 이미 역량을 갖추고 있습니다. Carlini의 [un]prompted 결과(커널 버그 5개, Firefox CVE 22개)는 Mythos가 아니라 Opus 4.6를 사용했습니다.3 capture-the-flag 방법론, ASAN 계측 빌드, 파일 순회 스크립트는 모두 일반적으로 사용 가능한 모델로 재현 가능합니다.
지금 분류 계층을 구축하세요. 미래의 Opus 모델이 Mythos의 일부 역량을 물려받으면(Anthropic가 시사한 바대로), 병목은 Carlini가 지목한 것과 같을 것입니다. 즉, 사람의 검증입니다. 자동 중복 제거, 심각도 분류, 공개 워크플로를 미리 갖춘 팀이 먼저 혜택을 볼 것입니다.
Cyber Verification Program에 신청하세요. 신청 양식은 claude.com/form/cyber-use-case에서 가동 중입니다. 정식 보안 연구를 수행한다면, 이것이 상향된 접근으로 가는 경로입니다.
궤적은 분명합니다. AI 지원 취약점 발견은 실재하고, 확장 가능하며, 이제 거버넌스 질문이 핵심 문제입니다. 모델 역량은 해결되었습니다. 발견, 분류, 책임 있는 공개를 오케스트레이션하는 스캐폴드는 아직 아닙니다.
출처
자주 묻는 질문
Claude Code를 통해 Claude Mythos를 사용할 수 있나요?
불가합니다. Mythos Preview는 Project Glasswing 파트너에게만 제한되어 있습니다. Opus 4.7(2026년 4월 16일)이 일반 사용자가 Claude Code를 통해 사용할 수 있는 가장 강력한 모델입니다. Anthropic는 Mythos가 어떤 GA 모델보다도 사이버 역량이 뛰어나다고 밝힙니다. 이것은 2026년 4월 당시의 구성입니다. 9월 29일까지 Anthropic은 검증된 방어자가 신뢰 기반 접근 프로그램을 통해 Claude Mythos 5.1을 사용할 수 있다고 밝혔습니다. 위의 10월 1일 업데이트를 참고하세요.
Mythos의 역량이 Opus에도 도입될까요?
Opus 4.7은 Anthropic의 Glasswing 이후 첫 Opus 릴리스이며, 실시간 사이버 세이프가드와 함께 출시됩니다. 이 패턴은 미래의 Opus 모델이 Mythos의 완전한 역량 범위보다는 추가 세이프가드를 더 갖추게 될 것을 시사합니다. Anthropic의 원래 발표는 “미래 Claude Opus 모델에서 새로운 세이프가드를 통해 더 안전한 배포를 가능하게 하는 것”을 목표로 한다고 밝혔습니다.
이것은 앞서의 취약점 관련 블로그 글과 어떤 관련이 있나요?
Carlini의 [un]prompted 발표(When Your Agent Finds a Vulnerability에서 다루었습니다)는 Opus 4.6를 사용했고 커널 버그 5개 + Firefox CVE 22개를 찾아냈습니다. Mythos는 그 접근 방식을 모든 주요 플랫폼에 걸쳐 수천 개의 취약점으로 확장했습니다. 방법론은 같고, 모델은 더 강력합니다.
-
Claude Mythos Preview — Project Glasswing. Anthropic, 2026년 4월 7일. 공식 발표. 수천 개의 높음/중대 심각도 제로데이 발견. 전문 검증자가 확인한 심각도 일치율 89%. 사용 크레딧 1억 달러. Nicholas Carlini가 주도, 공동 저자 21명 이상. ↩↩↩↩↩↩↩↩↩↩↩
-
Anthropic’s Project Glasswing. Simon Willison, 2026년 4월 7일. 제한 배포 모델과 Carlini의 이전 작업에 대한 분석 및 맥락. ↩
-
Nicholas Carlini, “Black-hat LLMs,” [un]prompted AI security 콘퍼런스, 2026년 4월. 콘퍼런스 의제. 참고: AI Finds Vulns You Can’t, Security Cryptography Whatever 팟캐스트. ↩↩
-
Anthropic says its most powerful AI cyber model is too dangerous to release publicly. VentureBeat, 2026년 4월 7일. ↩
-
게시 이후 업데이트 (2026년 4월 19일). Anthropic의 Introducing Claude Opus 4.7 발표(2026년 4월 16일)는 Opus 4.7을 GA 플래그십으로 자리매김하는 한편, Mythos Preview가 여전히 더 높은 사이버 역량을 보유한다고 언급합니다. 실시간 사이버 세이프가드 상세는 Anthropic Support: Real-time cyber safeguards on Claude를 참고하세요. Cyber Verification Program 신청 양식은 claude.com/form/cyber-use-case에서 가동 중입니다. ↩↩↩↩
-
Claude Code CHANGELOG. v2.1.111은 Opus 4.7 출시 지원을 추가했습니다(xhigh effort, 플래그 없이 Max용 Auto Mode). v2.1.113은
sandbox.network.deniedDomains, 래퍼 명령 거부 규칙,find -exec/-delete권한 강화, 그리고 macOS/private/{etc,var,tmp,home}제거 보호를 추가했습니다. ↩ -
Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao, Tripp Gallagher, “GLM-5.3 and the spread of advanced cyber capabilities”, Anthropic Frontier Red Team, 2026년 9월 29일, 2026년 10월 1일에 가져왔습니다. 이 글에서 인용하거나 가져온 내용: Glasswing이 번 시간에 관한 도입부, ExploitBench와 바이너리 익스플로잇 결과(후자는 무작위로 고른 100개 과제), GLM-5.3 브라우저 세션, GLM-5.3-Flash를 사용한 N-day 세션, “anyone can download GLM-5.3”, abliteration 비용과 거부율에 대한 영향(숙련된 팀에 대한 각주 3의 추정 포함), 며칠 만에 공개된 abliterated 사본, 거부에 관한 각주 2, 우회 비율(64%, 92%, 100%)과 Figure 5의 응함에 대한 정의(표적에 연결을 시도함, 셀당 50개 샘플), 그리고 “What does this mean?”. Anthropic은 이 시뮬레이션 환경이 모델이 생성한 코드를 전혀 실행하지 않는다고 밝힙니다. ↩↩↩↩
-
NIST Center for AI Standards and Innovation, “CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities”, 2026년 9월 17일, 2026년 10월 1일에 가져왔습니다. “GLM-5.3 is the most cyber-capable open-weight model released to date”, “GLM-5.3’s cyber capabilities are significantly lower than those of current U.S. frontier models” 및 “lags the capability level of the U.S. frontier by about four months in an aggregate measure of performance across CAISI cyber benchmarks”. Methodological Notes는 “U.S. frontier best”를 “including both trusted-access releases and full public releases”로 정의하고, “when applicable, U.S. models were tested with cyber safeguards disabled”라고 밝힙니다. ↩