← 모든 글

Codex CLI vs Claude Code 2026: 아키텍처, 가격, 그리고 중국에서의 접근

여러 가이드에서: Claude Code & Codex CLI

Codex CLI와 Claude Code는 둘 다 터미널 네이티브 에이전트 도구로 나왔고, 2026년 중반에는 둘 다 두 개의 계층으로 안전성을 지킵니다. 아래에는 OS 수준 샌드박스가 있고, 그 위에는 프로그래밍 가능한 거버넌스 계층이 있습니다. 지금 두 도구를 가르는 건 무게중심과 깊이입니다. Codex는 커널 샌드박스를 앞세우고 hook 시스템은 작게 유지합니다. Claude Code는 이 분야에서 가장 풍부한 hook 표면을 앞세우고, 그 아래에 OS 수준의 샌드박스 실행을 더했습니다. 이 무게중심의 차이는 각 도구가 설정, 권한, 멀티 에이전트 워크플로, 팀 거버넌스를 다루는 방식까지 그대로 이어집니다. 아래 비교는 그 차이를 구체적인 판단 기준과 함께 정리하면서, 제가 이 사이트 전반에서 쌓아온 AI 엔지니어링 영역을 넓혀 갑니다.

저는 주력 도구로 Claude Code를 씁니다. 이 편향은 미리 밝혀 둡니다. 여기 적은 관찰은 프로덕션 작업, 블라인드 평가, 두 도구를 함께 쓰는 워크플로를 통해 두 도구를 매일 사용하면서 얻은 것입니다.

TL;DR: Codex는 주로 OS 커널 계층(Seatbelt, Landlock, seccomp)에서 안전성을 강제하고1, 그 위에 5개 이벤트짜리 작은 hook 시스템(CLI v0.124.0부터 안정)을 얹습니다. Claude Code는 애플리케이션 계층 거버넌스를 앞세워 2026년 8월 기준 31개의 프로그래밍 가능한 hook 이벤트를 제공하고2, 그 아래를 OS 수준으로 샌드박스된 Bash(Seatbelt/bubblewrap)로 받칩니다. 여기에 v2.1.219부터는 허용 목록에 없는 호스트를 아예 거부하는 strictAllowlist가 더해졌습니다. 두 도구 모두 큰 컨텍스트로 동작합니다. Claude Code의 기본값은 Max, Team Premium, Enterprise, API 계정에서는 Opus 5이고 Pro와 Team Standard에서는 Sonnet 5입니다(둘 다 네이티브 1M이며 Sonnet은 $2/$10, Opus는 $5/$25 per MTok)20. Codex CLI의 기본값은 GPT-5.6 계열입니다(Codex 안에서 기본 272K, model_context_window를 쓰면 872K이고, GPT-5.6 Sol은 최소 2026년 11월 21일까지 프로모션 가격 $4/$20 per MTok)1921. 클라우드 샌드박스에 작업을 위임하거나 커널 수준 격리가 필요하면 Codex를 쓰세요. 프로그래밍 가능한 거버넌스, 긴 호흡의 리팩터링, 보안 중심 코드 리뷰에는 Claude Code를 쓰세요. 가장 좋은 결과는 둘 다 쓸 때 나옵니다.

핵심 요약

  • 1인 개발자: 자신의 주력 언어 생태계에 맞는 쪽으로 시작하세요. 두 도구는 같은 저장소에서 충돌 없이 공존합니다(CLAUDE.md와 AGENTS.md는 서로 독립적입니다).
  • 팀 리드: Codex 프로파일은 명시적이고 감사 가능한 설정 전환을 제공합니다. Claude Code의 계층 구조는 맥락에 맞는 규칙을 자동으로 적용합니다. 팀이 명시적 통제를 선호하는지, 자동 적응을 선호하는지에 따라 고르세요.
  • 보안 엔지니어: Codex의 커널 샌드박스는 에이전트가 OS 수준에서 제한을 우회하지 못하게 막습니다. Claude Code의 hook은 에이전트와 프로세스 경계를 공유하지만 임의의 검증 로직을 쓸 수 있습니다. 다만 이제는 그 아래에 OS 수준으로 샌드박스된 Bash가 깔려 있습니다. 자신의 위협 모델에 맞는 도구를 고르세요.

어느 도구를 골라야 할까요? (페르소나별 판단 경로)

비교의 답은 읽는 사람이 누구냐에 따라 달라집니다. 이 페이지에 가장 자주 오는 독자별로 네 갈래 경로를 정리했습니다.

개인 프로젝트나 소규모 팀 프로젝트를 하는 1인 개발자

기본값은 Claude Code. $2/$10 가격으로 쓰는 Sonnet 5의 네이티브 1M 토큰 컨텍스트, 31개 이벤트 hook 거버넌스 시스템, 그리고 플러그인 마켓플레이스가 1인 개발자가 매일 마주치는 상황(대규모 코드베이스 리팩터링, 세션 연속성, 저장 시 포매팅 자동화)을 덮어 줍니다. 월 $20 Pro나 월 $100~200 Max는 예측 가능하고 넉넉합니다.

Codex CLI를 함께 쓸 때는: 신뢰할 수 없는 코드를 한 번 리뷰하려고 커널 수준 샌드박스가 필요할 때, 또는 ChatGPT Pro/Plus로 이미 주요 AI 지출을 감당하고 있어서 Claude를 더하는 게 중복처럼 느껴질 때입니다. 두 도구는 깔끔하게 공존하고, CLAUDE.mdAGENTS.md는 나란히 놓을 수 있습니다.

10~50명 규모 엔지니어링 조직의 팀 리드

기본값은 Claude Code. 프로그래밍 가능한 hook(린트 게이트, 보안 스캔, 금지 명령 차단)은 모델이 프롬프트 지시를 따라 주기를 바라는 대신, 팀 표준을 결정론적으로 코드화합니다. 관리형 설정을 쓰면 개별 개발자가 덮어쓸 수 없는 조직 차원의 정책을 리드가 정할 수 있습니다. claude agents CLI와 Agent Teams 프리미티브는 팀이 리뷰 워크플로에서 실제로 쓰는 패턴과 맞아떨어집니다.

Codex CLI를 함께 쓸 때는: 보안이 민감한 리뷰에 커널급 격리가 필요할 때(외부 계약 업체 코드나 신원이 불분명한 작성자의 오픈소스 PR 리뷰 등), 또는 팀이 Azure OpenAI / Microsoft Foundry를 통해 이미 OpenAI 도구 체계에 들어가 있을 때입니다. 일상 주력이 아니라 목적이 뚜렷한 리뷰 도구로 돌리세요.

보안 중심 리뷰어나 레드팀 연구자

기본값은 Codex CLI(적대적 입력용) + Claude Code(통제된 실행용). Codex의 커널 샌드박스는 macOS Seatbelt / Linux Landlock+seccomp로 애플리케이션 계층 아래에서 시스템 콜을 거부합니다. 그래서 적대적인 에이전트는 허용하지 않은 파일 시스템 영역에 말 그대로 손댈 수 없습니다. Claude Code의 hook은 애플리케이션 계층에서 돌지만, 2026년 초부터 샌드박스된 Bash가 그 아래에 OS 수준 바닥(Seatbelt/bubblewrap)을 깔아 두었고 v2.1.219의 strictAllowlist가 네트워크 정책을 더 단단하게 만들었습니다. 위협에 맞는 도구를 쓰세요.

Claude Code를 함께 쓸 때는: 리뷰 이후 동작을 프로그래밍하고 싶을 때입니다(분류 hook, 감사 로깅, 리포트 자동 생성). 전형적인 워크플로는 이렇습니다. Codex가 샌드박스 제약 아래에서 살펴보고, Claude Code가 분류와 정책 집행 계층을 맡습니다.

중국 본토에 있는 개발자

두 도구 다 동작하지만, 선택을 좌우하는 건 기능보다 연결성과 비용입니다. 결정하기 전에 중국에서 Codex와 Claude Code에 접근하기를 먼저 보세요.


아키텍처의 근본적 분기

Codex와 Claude Code의 가장 깊은 차이는 거버넌스가 어디에서 일어나느냐입니다. Codex는 macOS에서는 Seatbelt, Linux에서는 Landlock과 seccomp를 통해 커널 계층에서 안전성을 강제합니다1. OS가 파일 시스템 접근, 네트워크 호출, 프로세스 생성을 그 연산이 애플리케이션에 닿기 전에 제한합니다. 운영체제가 실행 전에 시스템 콜을 거부하기 때문에 모델은 이 제한을 우회할 수 없습니다.

Claude Code는 hook을 통해 애플리케이션 계층에서 안전성을 강제합니다. hook은 2026년 8월 기준 31개 생애주기 지점에서 동작을 가로채는 프로그램입니다2. Bash에 걸린 PreToolUse hook은 모든 명령을 검사하고, 임의의 로직으로 검증하고, 종료 코드 2로 차단할 수 있습니다. hook 시스템이 주는 건 프로그래밍 가능한 거버넌스입니다. 비즈니스 규칙을 코드화하고, 린터를 돌리고, 자격 증명을 스캔할 수 있습니다. 예전의 트레이드오프는 애플리케이션 계층 집행이 에이전트와 프로세스 경계를 공유한다는 점이었습니다. 그런데 그 경계선은 양쪽에서 흐려졌습니다. Claude Code는 2026년 1월 샌드박싱 릴리스 이후 OS 수준 프리미티브(macOS는 Seatbelt, Linux는 bubblewrap) 위에서 샌드박스된 Bash를 돌려 왔고, v2.1.219에서는 허용 목록에 없는 호스트를 그대로 거부하는 sandbox.network.strictAllowlist 설정이 추가됐습니다. 그리고 Codex는 v0.124.0에서 안정적인 hook 시스템을 갖췄습니다. config.toml 안에 [[hooks]] 블록으로 설정하는 5개 이벤트(SessionStart, UserPromptSubmit, AfterToolUse, AfterAgent, Stop)입니다. 다만 pre-tool 이벤트가 없어서 Claude의 PreToolUse처럼 도구 호출 이전에 발화하는 건 없습니다.

모든 안전 아키텍처는 표현력과 경계의 강도를 맞바꿉니다. 이 두 도구는 그 스펙트럼의 양 끝에서 출발해 각자 가운데로 옮겨 왔지만, 무게중심은 의도적으로 남아 있습니다. 커널 샌드박싱은 위협 모델에 적대적일 수 있는 에이전트가 포함될 때 말이 됩니다(악성 코드 리뷰, 신뢰할 수 없는 스크립트 실행). 애플리케이션 계층 hook은 위협 모델이 자신만만하지만 선의인 에이전트일 때 말이 됩니다(내 코드, 내 팀, 내 관례). 대부분의 개발자는 때에 따라 두 위협 모델 모두가 필요합니다.

설정 철학

Codex는 설정에 TOML을 씁니다. Claude Code는 JSON을 씁니다. 형식 차이는 표면적입니다. 철학 차이는 그렇지 않습니다.

Codex는 설정을 프로파일 중심으로 구성합니다. --profile로 명시적으로 전환하는 이름 붙은 프리셋입니다. careful 프로파일은 approval_policy = "untrusted"를 설정하고 샌드박스를 공격적으로 겁니다9. deep-review 프로파일은 더 강력한 모델로 바꿉니다. 이름을 골라서 직접 선택했으니 어떤 설정이 활성인지 항상 알 수 있습니다. 지시 계층에는 AGENTS.md를 씁니다. Linux Foundation 산하 Agentic AI Foundation의 오픈 표준으로3, Codex, Cursor, Copilot, Amp, Devin Desktop, Gemini CLI가 읽을 수 있습니다.

Claude Code는 설정을 계층 구조 중심으로 구성합니다. 관리형 설정(최우선)에서 시작해 커맨드라인, 로컬 프로젝트, 공유 프로젝트, 사용자 기본값으로 이어지는 다섯 계층입니다. CLAUDE.md 파일은 사용자, 프로젝트, 로컬 수준에서 범위를 가집니다. Skills, hook, 규칙 디렉터리가 계층을 더 얹습니다. 맥락에 맞는 설정이 자동으로 적용되지만, 활성 설정은 어느 한 파일에서도 보이지 않습니다. 계층을 읽어서 재구성해야 합니다.

프로파일은 명시성과 감사 가능성을 중시합니다. “어떤 설정이 활성이었나?”는 어떤 --profile 플래그가 전달됐는지 확인하면 답할 수 있습니다. 계층 구조는 자동화와 맥락 민감성을 중시합니다. 맞는 맥락이 자동으로 적용되는 대신, “지금 어떤 설정이 활성인가?”에 답하려면 최대 다섯 계층을 읽고 병합 순서를 이해해야 합니다. 이 트레이드오프는 실제로 존재합니다. 저도 프로젝트 수준 지시와 충돌하는 사용자 수준 CLAUDE.md 덮어쓰기에 몇 번 놀란 적이 있습니다. 명시적 프로파일이었다면 생기지 않았을 일입니다.

안전 모델 비교

항목 Codex CLI Claude Code
샌드박스 방식 커널 수준(macOS는 Seatbelt, Linux는 Landlock + seccomp) hook(31개 생애주기 이벤트) + OS 수준으로 샌드박스된 Bash(Seatbelt/bubblewrap, strictAllowlist는 v2.1.219 이상)
권한 수준 세 가지 샌드박스 모드: read-only, workspace-write, danger-full-access 도구별 패턴 기반의 세밀한 허용/거부 목록
탈출 저항성 높음: 애플리케이션 경계 아래에서 OS가 시스템 콜을 거부 중간~높음: hook은 프로세스 경계를 공유하지만, 샌드박스된 Bash가 OS 수준 격리를 더함
프로그래밍 가능성 보통: 샌드박스 모드와 5개의 안정적인 hook 이벤트(v0.124.0 이상, pre-tool 가로채기 없음) 높음: hook 스크립트 안의 임의 코드(bash, Python 등)
승인 정책 세 단계: untrusted, on-request, never 정규식 매칭이 되는 도구별 권한 패턴
네트워크 제한 샌드박스가 외부로 나가는 네트워크 접근을 통제 샌드박스 네트워크 허용 목록. strictAllowlist(v2.1.219)는 허용 목록에 없는 호스트를 묻지 않고 거부
알려진 취약점 유형 샌드박스 탈출(이론적. 2026년 8월 기준 공개된 CVE는 알려지지 않음) 프로젝트 설정 안의 악성 hook(프로젝트 신뢰 프롬프트로 완화)

패턴은 이렇습니다. Codex는 더 강한 경계와 더 거친 통제를 제공합니다. Claude Code는 더 약한 경계와 더 세밀한 통제를 제공합니다11. 무엇이 맞는지는 위협 모델에 달렸습니다. 신뢰할 수 없는 외부 코드를 리뷰한다면 커널 샌드박싱입니다. 신뢰할 수 있는 코드에 조직의 코딩 표준을 강제한다면 프로그래밍 가능한 hook입니다.

컨텍스트와 모델

2026년 9월 3일 업데이트. 아래 문단에 대한 정정 두 가지와 추가 한 가지입니다. 기록이 그대로 보이도록 아래 문단은 8월 11일에 쓴 그대로 둡니다.

첫째, Codex의 기본값입니다. OpenAI의 Codex 모델 페이지는 8월 10일 시점에 이미 gpt-5.6-sol을 기본 Power 설정으로 지목하고 있었으므로, “권장 기본값은 GPT-5.5”라는 서술은 이 글을 8월 11일에 갱신하던 때에 이미 낡은 것이었습니다. GPT-5.5는 GPT-5.6 Sol이 대체한 플래그십입니다. 9월 3일 기준으로 같은 페이지는 기본 모델을 더 이상 이름으로 지목하지 않고 “계정에서 사용할 수 있는 기본 Power 설정으로 시작하세요”라고만 적으며, 자격이 되는 Pro, Business, Enterprise 계정에 대해서는 Astra 롤아웃이 “Power 옵션을 Terra Light, Sol Light, Sol Medium, Astra Light, Astra Medium, Astra Extra High로 갱신합니다”라고 설명합니다. 아래에서 설명한 도구 안 컨텍스트 비대칭도 달라졌습니다. Codex 안에서 GPT-5.6 계열의 기본 창은 272,000 토큰이고(v0.144.6 릴리스 노트가 이 수치를 정정했습니다), 8월 20일 v0.149.0부터는 model_context_window 설정으로 Sol, Terra, Luna를 872,000까지 올릴 수 있지만 그래도 Claude Code의 1M에는 못 미칩니다. Codex 0.153.1의 모델 카탈로그도 GPT-5.5를 Codex 안에서 아래에 인용한 400K가 아니라 272,000으로 적고 있습니다.19

둘째, Claude Code의 기본값은 하나의 모델이 아니라 플랜별로 정해집니다. Anthropic의 모델 설정 문서는 “Max, Team Premium, Enterprise, Anthropic API: Opus 5가 기본값”과 “Pro와 Team Standard: Sonnet 5가 기본값”을 열거합니다. 아래에서 8월 31일까지의 도입 가격이라고 설명한 Sonnet 5의 $2/$10 per MTok은 이제 표준 가격이며, 예정돼 있던 인상은 일어나지 않았습니다.20

셋째, 비교의 구도를 바꾸는 모델입니다. OpenAI는 9월 3일 GPT-6 Astra를 공개했습니다. 100만 입력 토큰당 $10, 캐시 입력 $1, 출력 $50이고, 컨텍스트 창은 1,050,000 토큰, 최대 출력은 128,000입니다. 긴 창에는 할증이 붙습니다. “272K를 넘는 입력 토큰이 들어간 프롬프트는 요청 전체에 대해 입력과 캐시 요율 2배, 출력 1.5배로 과금됩니다.” 제공 범위는 원문 그대로 이렇습니다. “GPT‑6 Astra는 오늘 Trusted Access Program에 속한 기업을 대상으로 배포를 시작하며, API와 Plus, Pro, Business, Enterprise 플랜을 통한 접근은 며칠 안에 제공될 예정입니다.” 같은 날 Codex CLI 0.153.1은 “기본 모델을 바꾸거나 모델 선택기에 노출하지 않으면서 API를 통해 GPT-6-Astra를 설정할 수 있는 지원을 추가했습니다”라고 밝혔습니다. Anthropic 쪽에서 일반 제공 범위의 최상단에 있는 대응 모델은 Claude Fable 5.1(9월 1일)입니다. $10/$50 per MTok에 캐시 읽기 $0.25, 1M 컨텍스트입니다. 이제 두 벤더 모두 코딩 기본값 위에 기본 요율 $10/$50짜리 플래그십을 두고 있습니다. 9월 3일 기준으로 Astra 모델 페이지에 따르면 Trusted Access Program 밖의 접근은 아직 예정 단계였고, Codex 모델 페이지에 따르면 Astra Power 옵션은 자격이 되는 계정에만 닿고 있었습니다. 어느 벤더도 자사 플래그십을 코딩 도구의 기본값으로 삼지 않습니다.1920

2026년 8월 기준으로 Codex CLI가 권장하는 기본값은 GPT-5.5(2026년 4월 23일 출시)입니다4. Codex 안에서는 400K 컨텍스트, API에서는 1M, $5/$30 per MTok, 그리고 Terminal-Bench 2.0에서 82.7%로 출시 시점에 공개된 모델 중 최고 수준이었습니다. 직전 플래그십인 GPT-5.4는 1.05M 실험적 롱 컨텍스트 모드(입력 272K를 넘으면 입력 2배 / 출력 1.5배 과금)와 함께 API에서 계속 쓸 수 있지만4, Codex v0.145.0(2026년 7월 21일)은 번들된 GPT-5.4 선택지를 GPT-5.6의 Terra와 Luna 변형(각각 272K 컨텍스트)으로 옮겼습니다. gpt-5.2-codex 스냅샷은 2026년 7월 23일에 종료됐습니다. 여기에 고정해 둔 스크립트는 이제 실패하고, OpenAI가 권장하는 대체는 GPT-5.6 Sol입니다.4

Claude Code는 v2.1.197(2026년 6월 30일)부터 기본값이 Sonnet 5입니다. 네이티브 1M 토큰 컨텍스트, 최대 출력 128K, $3/$15 per MTok이고 2026년 8월 31일까지는 도입 가격 $2/$10이 적용됩니다5. opus 별칭은 v2.1.219(2026년 7월 24일)부터 Opus 5를 가리킵니다. 1M 컨텍스트, 최대 출력 128K, $5/$25 per MTok이고, Anthropic은 이를 Opus 4.8 대비 같은 가격의 성능 업그레이드로 자리매김했습니다. 두 벤더 모두 기본 모델과 컨텍스트 한도를 릴리스마다 바꾸니, 현재 값은 각 벤더 페이지에서 확인하세요.

이제 두 도구 모두 큰 컨텍스트를 잘 다루는데, 한 가지 비대칭이 있습니다. Claude Code의 기본 모델은 도구 안에서 네이티브로 1M이고 롱 컨텍스트 할증도 없습니다. 반면 Codex는 GPT-5.5를 Codex 안에서 400K로 제한합니다(1M 창 전체는 API 전용입니다). 모노레포를 한 창에 통째로 넣는 작업이라면 지금은 도구 안에서의 우위가 Claude Code에 있습니다. 다만 대부분의 프로젝트에서는 창 크기 자체보다 검색 품질(각 도구가 관련 코드를 얼마나 잘 찾아내는지)이 더 중요합니다.

여기까지가 8월 11일 본문이며, 위의 9월 3일 업데이트가 이를 대체합니다.

공개 벤치마크는 어떤 비교 글보다도 빠르게 움직입니다. 2026년 4월 스냅샷에서는 Opus 4.7이 SWE-bench Verified(87.6%)와 SWE-bench Pro(64.3%)를 앞섰고, Terminal-Bench 2.0에서는 GPT-5.4(75.1%)와 GPT-5.3-Codex(77.3%)가 앞섰습니다12. GPT-5.5는 4월 23일 출시 시점에 Terminal-Bench 2.0을 82.7%로 지켰고, 당시 공개된 모델 중 최고 수준이었습니다4. 그 뒤로 두 벤더 모두 새 모델을 내놓았습니다. OpenAI는 GPT-5.6 Sol과 GPT-6 Astra를, Anthropic은 같은 비용의 성능 업그레이드인 Opus 4.8(5월)과 Opus 5(7월), 그리고 그 위에 $10/$50의 Fable 5.1(9월 1일)을 내놓았습니다.1920 이 글에는 그 이후 모델들에 대한 벤치마크 표가 없습니다. 여기 나온 숫자는 모두 특정 시점의 측정치로 다루고, 결정하기 전에 벤더 페이지를 확인하세요. 제가 이전 버전의 Opus로 진행한 블라인드 평가에서는 컨텍스트가 더 작을 때도 리뷰와 보안 작업에서 앞섰고, 1M에서도 같은 패턴이 이어집니다.

두 도구 모두 모델 라우팅을 지원합니다. Codex는 프로파일별로 모델을 고릅니다9. Claude Code는 플랜에 따라 Opus 5나 Sonnet 5를 기본값으로 쓰고 opus 별칭은 Opus 5를 가리키며, 호출마다 --model이나 설정 수준 구성으로 덮어쓸 수 있습니다.

가격 심층 분석

가격은 세 가지 패턴으로 나뉩니다. 토큰 단위 API 과금, 에이전트 CLI 사용을 포함하는 구독, 그리고 AWS / GCP / Azure를 통한 클라우드 제공업체 과금입니다. 가장 저렴한 경로는 표시 가격이 아니라 하루 토큰 사용량이 결정합니다.

Claude Code 가격(2026년 9월 3일 검증)

토큰 단위(Anthropic API):13

모델 입력($/MTok) 출력($/MTok) 캐시 읽기($/MTok) 5분 캐시 쓰기($/MTok) 1시간 캐시 쓰기($/MTok)
Claude Opus 5 $5.00 $25.00 $0.50 $6.25 $10.00
Claude Sonnet 5 $2.00 $10.00 $0.20 $2.50 $4.00
Claude Haiku 4.5 $1.00 $5.00 $0.10 $1.25 $2.00

Sonnet 5의 $2/$10은 출시 시점에는 도입 가격이었지만 지금은 표준 가격이며, 9월 1일 인상은 취소됐습니다. Opus 4.8, 4.7, 4.6은 레거시 모델로 같은 $5/$25 요율에 계속 제공됩니다. 롱 컨텍스트 할증은 없습니다. Opus 5와 Sonnet 5의 1M 토큰 창은 표준 요율로 제공됩니다. Batch API는 입력과 출력에 50% 할인을 줍니다.13

Claude Code가 포함된 구독:8

플랜 월 요금 Claude Code 사용 프로필
Pro $20 하루 한도가 넉넉함. 무거운 에이전트 작업을 계속하면 추가 사용 게이트에 걸림
Max 5x $100 Pro의 Claude 사용량 5배. 1인 개발자의 일상 주력 한도
Max 20x $200 Pro의 20배. 혼자 무거운 리팩터링을 하는 날 대부분을 감당
Team Standard $30/사용자 공유 관리 기능이 있는 좌석 단위
Team Premium $150/사용자 모든 좌석에서 Opus를 기본으로 사용 가능
Enterprise 별도 협의 관리형 정책, SSO, 감사가 포함된 좌석 단위

클라우드 제공업체 가격은 AWS Bedrock / Google Vertex AI / Microsoft Foundry의 정가를 따릅니다. Anthropic의 직접 API와 거의 비슷하게 움직이지만 리전별 제공 여부와 데이터 소재지 차이가 있습니다.

Codex CLI 가격(2026년 9월 4일 검증)

토큰 단위(OpenAI API):14

OpenAI가 모델 변형을 교체할 때마다 가격이 바뀝니다. GPT-5.6 Sol, GPT-6 Astra, GPT-5.5 행은 2026년 9월 4일에 검증했고, 나머지 행은 2026년 8월 8일 기준입니다. GPT-5.6 Sol은 입력이 272K를 넘으면 요청 전체가 $8/$30으로 과금됩니다.

모델 입력($/MTok) 캐시 입력($/MTok) 출력($/MTok) 컨텍스트 / 최대 출력
GPT-5.6 Sol(Codex 기본 계열. 최소 2026년 11월 21일까지 프로모션 요율) $4.00 $0.40 $20.00 Codex 기본 272K, model_context_window 사용 시 872K. API 1.05M / 출력 128K21
GPT-6 Astra(API로 설정 가능. Codex 0.153.1 선택기에는 노출되지 않음) $10.00 $1.00 $50.00 API 1.05M / 출력 128K. 입력 272K 초과 시 2배/1.5배1921
GPT-5.5(Codex 기본값 자리를 GPT-5.6 Sol에 내줌) $5.00 $0.50 $30.00 0.153.1 카탈로그 기준 Codex 272K. API 1.05M / 출력 128K. 입력 272K 초과 시 2배/1.5배1921
GPT-5.4(직전 플래그십) $2.50 $0.25 $15.00 기본 272K, 롱 컨텍스트 1.05M / 출력 128K
GPT-5.3-Codex OpenAI 가격 페이지 참고 해당 없음 OpenAI 가격 페이지 참고 입력 272K / 출력 128K
GPT-5 티어에 따라 다름 해당 없음 다름 입력 최대 400K

gpt-5.2-codex 스냅샷은 OpenAI의 지원 중단 표에 따라 2026년 7월 23일에 종료됐습니다. OpenAI가 권장하는 대체는 GPT-5.6 Sol입니다.4 GPT-5.4의 롱 컨텍스트 프롬프트(입력 272K 토큰 초과)는 해당 세션에 대해 입력 2배, 출력 1.5배로 과금되고 이는 standard, batch, flex 티어 모두에 적용됩니다.4

Codex가 포함된 구독:

ChatGPT Plus(월 $20), Pro(5x 티어는 월 $100부터, 20x는 월 $200), Business(Codex 전용 좌석의 종량제, 또는 Codex 사용 한도가 있는 표준 ChatGPT Business 좌석)는 모두 플랜별 상한과 함께 Codex 계열 사용을 포함합니다. GPT-5.5, GPT-5.4, GPT-5.3-Codex는 모두 OpenAI API로 쓸 수 있고, 지원되는 API 티어에 대해 공개된 토큰 단가와 요청 한도가 있습니다(무료 티어는 미지원).14 API만 쓰는 팀은 구독을 아예 건너뛰면 됩니다. 번들된 Codex 사용량과 더 넓은 채팅 표면이 팀에 더 값어치가 있을 때 ChatGPT 구독을 쓰세요.

Opus 5의 1M 컨텍스트는 실제로 얼마인가

실무적인 질문은 이것입니다. “Opus 5에 1M 토큰짜리 코드베이스를 넣으면 청구서는 얼마인가?”

10K 토큰 응답을 포함한 풀 컨텍스트 1회 처리: - 입력: 1,000,000 토큰 × $5.00/MTok = $5.00 - 출력: 10,000 토큰 × $25.00/MTok = $0.25 - 합계(캐싱 없음): 1회당 $5.25

1M 토큰 코드베이스에 5분 프롬프트 캐싱을 쓸 때(캐시 쓰기는 한 번, 후속 질문에서 반복 읽기 가정): - 첫 쓰기: 1,000,000 × $6.25/MTok = $6.25(1회성) - 5분 이내 이후 읽기마다: 1,000,000 × $0.50/MTok + 출력 10,000 × $25/MTok = $0.75 - 한 세션에서 다섯 번 읽기: $6.25 + (5 × $0.75) = 풀 컨텍스트 다섯 번에 $10.00

1 USD ≈ 6.82 CNY라는 참고 환율(2026년 4월 무렵 PBOC 기준 환율은 6.82~6.90 구간에 몰려 있었습니다)로 환산한 예시: 1M 토큰 코드베이스에 대한 Opus 5 풀 컨텍스트 다섯 세션이 약 ¥68.20. 환율은 움직입니다. 조달 문서에 인용하기 전에 현재 환율을 확인하세요. 예산 산정에서 중요한 건 정확한 위안화 숫자가 아니라 이 계산 방식입니다.

GPT-5.4의 롱 컨텍스트 모드로 같은 계산을 하면 이렇습니다(직전 플래그십입니다. GPT-5.5의 1.05M 창은 API 전용이고 입력 272K를 넘으면 입력 2배, 출력 1.5배로 과금되므로, 캐싱 없는 같은 풀 1M 처리는 $10.45입니다): - 입력: 1,000,000 토큰 × (기본 $2.50 × 롱 컨텍스트 배수 2) = $5.00 - 출력: 10,000 토큰 × (기본 $15.00 × 롱 컨텍스트 배수 1.5) = $0.225 - 합계(캐싱 없음): 1회당 $5.23로, 풀 1M 컨텍스트에서 캐싱 없는 Opus 5 가격과 1% 이내 차이

GPT-5.3-Codex(입력 상한 272K)에서는 같은 1M 코드베이스를 넣으려면 최소 네 번은 나눠야 하고, 그러면 세션 단위 비용 구조가 달라집니다. 중국 개발 팀 대부분은 매일 풀 1M 컨텍스트가 필요하지는 않으니, 현실적인 비교는 일반적인 세션 크기(50K~200K 토큰)에서 이뤄집니다. 그 구간에서는 두 도구 다 세션당 $1 미만입니다.

구독이 토큰 단가보다 나을 때

대략적인 기준입니다(Anthropic이 공개한 토큰 할당량이 없으니 공표된 수치는 아닙니다). 가벼운 대화형 사용은 Pro로 편하게 들어갑니다. Opus 5로 매일 좀 더 무거운 에이전트 워크플로를 돌리면 Max 5x나 Max 20x 영역으로 넘어갑니다. 풀 컨텍스트를 계속 쓰는(세션당 $5 이상) 작업은 공격적인 프롬프트 캐싱과 함께라면 상한이 있는 구독보다 토큰 종량제가 더 쌀 수 있습니다. 공식으로 추측하지 말고, 대표적인 한 주를 Pro로 돌려 보고 Claude 사용량 대시보드를 확인한 뒤 필요에 따라 티어를 올리세요. 팀도 사용자별로 같은 계산을 하되, Enterprise 티어가 흡수해 주는 관리·정책·SSO 부담을 더해서 보면 됩니다.

중국에서 Codex와 Claude Code에 접근하기

OpenAI와 Anthropic의 퍼스트파티 API 접근은 각 제공업체가 공개한 지원 국가 목록에 따르면 중국 본토에서는 공식적으로 지원되지 않습니다.18 이를 우회하려고 본토 밖 네트워크와 계정으로 우회 접속하는 개발자도 있지만, 그렇게 하면 계정 정지와 컴플라이언스 리스크를 떠안게 되고 이를 생산성 논리와 저울질해야 합니다. CLI 바이너리는 한 번 내려받으면 로컬에 설치돼 돌아가고, 일상적인 에이전트 루프 동작은 어디서나 같습니다. 정당한 경로가 있는 곳은 클라우드 제공업체를 통한 라우팅입니다.

AWS Bedrock 리전 제공 현황

Anthropic의 Claude 모델은 특정 AWS 리전에서 Amazon Bedrock을 통해 제공됩니다. 2026년 4월 기준으로 공개된 Bedrock 런타임 엔드포인트는 도쿄, 서울, 싱가포르, 뭄바이, 시드니를 포함한 APAC 리전을 덮지만, 중국 본토나 홍콩에서 운영되는 Bedrock 런타임 엔드포인트는 현재 없습니다.15 AWS를 경유하는 중국 고객은 그에 따르는 지연 비용을 감수하고 보통 싱가포르나 도쿄를 씁니다.

Google Vertex AI 리전 제공 현황

Google Cloud는 아시아 태평양 리전에서 Vertex AI 생성형 AI 엔드포인트를 제공합니다.16 Claude 모델별 제공 여부는 리전에 따라 다르고, asia-east2(홍콩)는 그동안 중국 남부 사용자에게 더 낮은 지연을 제공해 왔습니다. 결정하기 전에 고른 Vertex 리전에서 Claude 모델을 쓸 수 있는지 확인하세요. 커버리지는 시간이 지나며 넓어지지만 APAC 전역에서 균일하지는 않습니다.

Microsoft Foundry

Claude는 Microsoft Foundry를 통해 Azure의 글로벌 표준 배포에서 쓸 수 있고, 보통 자격 요건을 갖춘 Enterprise / MCA-E 구독이 필요합니다. Claude가 Azure China(21Vianet 운영)에서 제공된다는 공식 문서는 없습니다. 이쪽은 서비스 카탈로그가 별개인 독립 주권 클라우드입니다. Foundry를 쓰는 중국 고객은 Azure China가 아니라 글로벌 Azure 인프라를 경유하게 됩니다.17

중국에서 쓰는 OpenAI Codex

OpenAI의 지원 국가 목록에는 중국 본토가 없습니다. OpenAI는 미지원 지역에서의 접근이 계정 차단이나 정지로 이어질 수 있다고 경고합니다.18 Azure OpenAI는 특정 글로벌 리전에서 제공되고(Azure China는 아닙니다), 컴플라이언스에 맞는 접근을 원하는 중국 기업은 OpenAI API를 직접 쓰려 하기보다 적절한 계약 조건을 갖춘 허용 리전의 Azure OpenAI를 경유하는 게 일반적입니다.

중국 제공업체의 모델 대안

DeepSeek, Qwen(알리바바), Kimi(Moonshot)는 중국 팀이 비용과 지연 때문에 검토하는 모델 수준의 대안입니다. 이들은 모델이지 에이전트 CLI가 아닙니다. Claude Code와 붙이려면 Anthropic API 호환 어댑터나 게이트웨이가 필요합니다(Claude Code는 Anthropic의 요청/응답 형태를 기대하고, ANTHROPIC_BASE_URL은 OpenAI 호환이 아니라 Anthropic 호환 엔드포인트를 가리킵니다). Codex는 프로파일 수준 모델 라우팅을 지원하지만 마찬가지로 OpenAI 호환 응답을 기대합니다. 두 도구 중 어느 쪽도 DeepSeek/Qwen/Kimi를 일급으로 지원하지 않고, 경로는 제공업체의 API 형태와 CLI가 기대하는 형태 사이를 번역하는 어댑터 계층입니다. 조달, 지연, 데이터 소재지 질문에는 이 모델들이 잘 답해 줍니다. 에이전트 루프의 정확성과 도구 호출 성숙도 질문에는 여전히 이 CLI들이 맞춰 조정된 프런티어 Claude와 GPT 모델이 제일 낫습니다.

멀티 에이전트 기능

Codex는 codex cloud exec로 클라우드에 작업을 위임하는 기능을 제공합니다6. OpenAI가 아직 실험적이라고 표시해 둔 표면입니다. 작업을 설명하면 Codex가 클라우드 환경을 띄우고 여러분의 코드베이스에 에이전트를 돌린 뒤 diff를 돌려줍니다. 에이전트의 추론을 실시간으로 지켜보지는 못합니다. 작업을 미리 정의하고 결과는 나중에 수거하는 방식입니다. 클라우드 위임은 CI/CD 파이프라인과 배치 처리에 자연스럽게 맞습니다. 로컬 병렬 처리 쪽에서는 멀티 에이전트 v2 경험이 v0.145.0(2026년 7월 21일)에서 옵트인으로 안정화됐고, 서브 에이전트 모델·추론 수준·동시성을 설정할 수 있습니다7.

Claude Code는 Task 도구로 서브 에이전트를 명시적으로 띄우는 기능을 제공하고10, 이 표면은 2026년 동안 크게 자랐습니다. 서브 에이전트는 v2.1.198부터 기본적으로 백그라운드에서 돌고, 깊이 3까지 중첩된 서브 에이전트를 띄울 수 있으며, v2.1.219 기준으로 기본 최대 20개까지 동시에 돕니다. 여기에 동적 워크플로(/workflows, v2.1.154 이상)가 더 큰 편대를 지휘합니다. 부모 에이전트는 구체적인 작업과 격리된 컨텍스트를 주고 서브 에이전트를 띄우고, 결과를 조율하고, 출력을 합성합니다. 서브 에이전트 생성은 대화형 오케스트레이션을 가능하게 합니다. 추론이 보이니까 개입할 수 있습니다. 여러 에이전트가 서로의 출력을 비평하는 숙의 패턴과 결합하면, 대화형 오케스트레이션은 던져 놓고 잊는 방식이 놓치는 문제를 잡아냅니다.

클라우드 작업은 작업을 미리 정의하고 결과를 나중에 받고 싶은 워크플로에 맞습니다. 서브 에이전트 조율은 추론을 거치며 작업이 변해 가고 실시간 합성이 필요한 워크플로에 맞습니다.

신뢰 스펙트럼

판단 매트릭스를 보기 전에, 여러분의 작업이 신뢰 스펙트럼의 어디에 있는지 생각해 보세요. 모든 에이전트 코딩 작업에는 암묵적인 신뢰 판단이 들어 있습니다. 이 특정 작업에서 에이전트의 판단을 얼마나 믿느냐는 것입니다.

낮은 신뢰(Codex 사용): 내가 쓰지 않은 코드를 리뷰하거나, 외부에서 온 스크립트를 실행하거나, 실시간으로 지켜볼 수 없는 클라우드 환경에 작업을 위임하는 상황입니다. 에이전트가 적대적 입력을 마주칠 수도 있습니다. 모델이 무엇을 결정하든 OS가 경계를 지켜 주기를 원하는 상황입니다.

중간 신뢰(둘 다 가능): 패턴을 아는 내 코드베이스에서 작업하는 상황입니다. 에이전트가 실수할 수는 있지만, 그건 악의가 아니라 자신감 과잉에서 오는 실수입니다. 변경이 반영되기 전에 리뷰하고 싶지만 커널 수준 격리까지는 필요하지 않습니다.

높은 신뢰(Claude Code 사용): hook, CLAUDE.md 지시, 허용 목록 권한으로 가드레일을 만들어 둔 상황입니다. 에이전트는 여러분이 설계한 통제된 환경 안에서 움직입니다. 전면 차단 대신 선택적으로 동작을 승인할 만큼 거버넌스 계층을 믿는 상태입니다.

대부분의 개발자는 대부분의 시간을 중간 신뢰에서 보냅니다. 두 도구를 함께 쓰는 워크플로가 통하는 이유가 여기 있습니다. 샌드박스가 빛나는 낮은 신뢰 작업은 Codex가 맡고, 커널 제한보다 프로그래밍 가능한 hook이 더 값어치를 내는 중간~높은 신뢰 작업은 Claude Code가 맡습니다.

판단 프레임워크

구체적인 필요를 기준으로 한 실전 판단 매트릭스입니다.

이런 게 필요하다면… 최선의 선택 이유
커널 수준 샌드박싱 Codex OS 수준 집행은 에이전트가 우회할 수 없음
프로그래밍 가능한 거버넌스 hook Claude Code 임의 코드를 실행하는 31개 생애주기 이벤트. Codex의 5개 이벤트 hook 시스템은 pre-tool을 가로챌 수 없음
도구 간 이식성(AGENTS.md) Codex 오픈 표준이 Codex, Cursor, Copilot, Amp, Devin Desktop에서 동작
여러 파일에 걸친 깊은 리팩터링 Claude Code Opus는 긴 세션 내내 아키텍처 맥락을 붙들고 있는 데 강함
던져 놓고 잊는 클라우드 작업 Codex codex cloud exec가 클라우드 인프라에 위임하고 diff를 돌려줌
실시간 대화형 추론 Claude Code 확장 사고 + 서브 에이전트 조율을 실시간으로 지켜보며 사용
신뢰할 수 없는 외부 코드 리뷰 Codex --sandbox read-only가 파일 시스템 변경을 전부 차단
팀 코딩 표준 강제 Claude Code hook이 비즈니스 로직을 코드화하고 결정론적으로 강제
대규모 모노레포 적재 Claude Code(근소하게) Sonnet 5와 Opus 5는 도구 안에서 네이티브 1M. Codex는 기본 272K, model_context_window를 쓰면 872K. 1.05M API 창은 입력 272K를 넘으면 2배/1.5배 할증(9월 3일 업데이트 참고)
보안 중심 코드 리뷰 Claude Code 제 블라인드 평가 시리즈의 리뷰 작업에서 Opus가 앞섰음

이 매트릭스를 어느 한 도구가 장악하지는 않습니다. 밑바탕의 패턴은 열 줄이 시사하는 것보다 단순합니다. Codex는 단단한 경계가 필요할 때 빛나고, Claude Code는 프로그래밍 가능한 로직이 필요할 때 빛납니다. 신뢰할 수 없는 코드를 실행하거나, 외부 기여를 리뷰하거나, 지켜볼 수 없는 클라우드 환경에 위임한다면 단단한 경계가 더 중요합니다. 팀 관례를 강제하거나, 다단계 워크플로를 지휘하거나, 비즈니스 규칙을 코드화한 가드레일을 만든다면 프로그래밍 가능한 로직이 더 중요합니다. 여러분의 필요 중 셋 이상이 한 도구를 가리킨다면 거기서 시작하세요. 반반으로 갈린다면 두 도구를 함께 쓰는 워크플로를 고려해 보세요.

제 권장안

둘 다 쓰세요. 저는 동일한 코드 리뷰 작업을 12개 작업 범주에 걸쳐 두 도구에 통과시켜 봤고(제 블라인드 평가 시리즈에 기록해 뒀습니다), 어느 한 도구도 혼자서는 전부 잡아내지 못한다는 걸 확인했습니다. 구체적인 예를 들어 보겠습니다. FastAPI 인증 리뷰 중에 Opus가 비밀번호 비교 함수의 타이밍 사이드 채널을 짚어냈습니다. 비교에 hmac.compare_digest() 대신 Python의 == 연산자를 써서 타이밍 오라클을 만들고 있었습니다11. Codex는 이 문제를 완전히 놓쳤습니다. 같은 코드베이스에서 Codex의 샌드박스는 사용자가 넘긴 URL이 내부 서비스에 닿을 수 있는 URL 조회 엔드포인트의 SSRF 벡터를 잡아냈습니다. Opus는 애플리케이션 수준에서 입력 검증이 맞아 보였기 때문에 그 엔드포인트를 승인했지만, 커널 샌드박스는 내부 IP 대역으로 나가는 네트워크 요청을 잡아냈습니다. 다른 데이터로 학습한 다른 모델은 다른 취약점 유형을 잡아냅니다. 둘 다 돌리면 리뷰당 비용이 대략 2배가 되지만, 보안이 민감한 코드에서는 의미 있는 차이로 더 많은 문제를 잡아냅니다.

제 일상 워크플로는 작업 유형으로 나뉩니다.

  • Claude Code는 기능 구현, 코드 리뷰, 여러 파일에 걸친 리팩터링을 맡습니다. hook이 포매팅을 강제하고, 위험한 명령을 차단하고, 편집할 때마다 테스트를 돌립니다. 대화형 서브 에이전트 모델은 추론을 거치며 변해 가는 작업에 잘 맞습니다.
  • Codex--sandbox read-only로 신뢰할 수 없는 코드를 리뷰하고(외부 PR과 의존성은 커널 샌드박스 안에서 봅니다), codex cloud exec로 클라우드에 위임하는 배치 작업을 돌리고, 다른 모델의 관점이 사각지대를 짚어 주는 아키텍처 세컨드 오피니언을 맡습니다.

CLAUDE.md와 AGENTS.md는 같은 저장소에서 충돌 없이 공존합니다. 두 파일이 내용 대부분을 공유하니 유지 부담도 최소입니다. 저는 관례를 담은 공용 섹션을 하나 두고 양쪽에 복사해 넣습니다.

둘 다 쓰면 안 되는 경우. 보장된 결정성이 필요할 때는 Codex도 Claude Code도 맞는 선택이 아닙니다. 두 도구 모두 확률적이라 같은 프롬프트로도 실행마다 다른 출력이 나올 수 있습니다. 워크플로가 정확한 재현성을 요구한다면(예를 들어 스키마와 바이트 단위로 일치해야 하는 설정 파일 생성), 템플릿 엔진이나 코드 생성기를 대신 쓰세요. 에이전트 도구는 작업에 판단이 필요할 때 가장 강하고, 판단 없는 정밀함이 필요할 때 가장 약합니다.

블라인드 평가 방법론과 12개 작업 범주의 결과를 포함한 전체 비교는 Claude Code vs Codex: 언제 무엇을 쓸까를 보세요. 각각을 시작하는 방법은 Claude Code 가이드Codex 가이드에 있습니다. Claude Code의 거버넌스 계층을 떠받치는 hook 시스템의 실전 안내는 hook 튜토리얼에서 볼 수 있습니다.

참고 문헌

FAQ

같은 프로젝트에서 Codex와 Claude Code를 같이 쓸 수 있나요?

네. CLAUDE.md와 AGENTS.md는 각 도구가 독립적으로 읽는 별개 파일입니다. 어느 도구도 상대의 지시 파일을 해석하지 않습니다. 설정 파일도 충돌하지 않습니다. 저는 활성 프로젝트마다 둘 다 유지합니다. 유일하게 신경 쓸 점은 지시 파일 사이에서 공용 내용을 동기화하는 건데, 형식이 비슷해서 몇 분이면 끝납니다.

일상 사용에는 어느 쪽이 더 저렴한가요?

위의 가격 심층 분석 절을 보세요. 요약하면, Claude Code는 Anthropic API 토큰 단가(Sonnet 5는 $2/$10으로, 출시 시점에는 도입 가격이었지만 지금은 표준 가격입니다. Opus 5는 $5/$25)에 구독 사다리(Pro $20, Max 5x $100, Max 20x $200, Team $30/사용자, Team Premium $150/사용자)를 더한 구조입니다. Codex CLI는 OpenAI API 토큰 단가(GPT-5.6 Sol은 입력 $4 / 출력 $20 per MTok로, 최소 2026년 11월 21일까지 유효한 프로모션 요율입니다. GPT-5.5는 $5 / $30)와 GPT-5.4 / GPT-5.3-Codex 계열에 ChatGPT Plus/Pro 포함분을 더한 구조입니다. 토큰 효율은 작업 유형마다 다르니, 예산이 민감한 작업이라면 대표 작업을 양쪽에 돌려 보고 실제 청구액을 비교하세요. 토큰 단가는 제공업체마다 달라서 원시 토큰 수가 비용으로 그대로 이어지지는 않습니다.

큰 코드베이스는 어느 쪽이 더 잘 다루나요?

둘 다 큰 저장소를 잘 다룹니다. Claude Code의 기본값(플랜에 따라 Opus 5 또는 Sonnet 5)은 표준 가격으로 네이티브 1M 토큰입니다. Codex의 기본 계열인 GPT-5.6은 Codex 안에서 기본 272K로 돌고 model_context_window를 쓰면 872K가 되며, 1.05M 창(GPT-5.6 Sol, GPT-6 Astra, GPT-5.5 모두 입력이 272K를 넘으면 입력 2배, 출력 1.5배로 과금됩니다)은 API 쪽에 있습니다. 컨텍스트와 모델 절의 9월 3일 업데이트를 함께 보십시오. 어느 도구도 코드베이스 전체를 한 번에 읽지는 않고, 일상 작업에서는 둘 다 검색에 기댑니다(Claude Code는 코드베이스 검색과 계층화된 CLAUDE.md로 맥락을 미리 얹고, Codex는 검색 기반 파일 탐색을 씁니다). 창 크기 자체가 가장 크게 작용하는 건 한 턴 안에서 여러 파일에 걸친 관계를 추론할 때이고, 거기서는 지금 Claude Code가 도구 안 창이 더 큽니다.

Codex CLI는 로컬에서 도나요, 클라우드에서 도나요?

둘 다지만 같은 모드는 아닙니다. Codex CLI는 기본적으로 로컬에서 돌고, 여느 터미널 도구와 같은 방식입니다.1 클라우드 위임은 codex cloud exec나 Codex Cloud를 통한 별도 흐름으로, OpenAI가 호스팅하는 인프라의 컨테이너에서 작업을 실행하고 diff를 돌려줍니다. 사람들이 “Codex 샌드박스”라고 할 때 보통 가리키는 게 Codex Cloud입니다. Codex CLI의 로컬 샌드박싱은 위 안전 모델 절에서 설명한 커널 수준 Seatbelt / Landlock 경로입니다.

중국 본토에서 Claude Code와 Codex에 접근할 수 있나요?

OpenAI와 Anthropic의 퍼스트파티 API 접근은 중국 본토에서 공식적으로 지원되지 않습니다. CLI 바이너리는 로컬에 설치돼 돌지만, 중국 본토에서 퍼스트파티 API로 트래픽을 보내면 계정 정지나 컴플라이언스 문제로 이어질 수 있습니다. 정당한 경로는 Azure OpenAI(중국이 아닌 특정 리전), AWS Bedrock(도쿄, 서울, 싱가포르, 뭄바이, 시드니를 포함한 가까운 공개 APAC 리전. 중국 본토나 홍콩 런타임 엔드포인트는 없음), Google Vertex AI(asia-east2 홍콩과 그 외 APAC 리전. 모델별 제공 여부 유의), 그리고 Claude의 경우 글로벌 Azure의 Microsoft Foundry(Azure China가 아닙니다)입니다. 자세한 내용은 위의 중국에서 Codex와 Claude Code에 접근하기를 보세요.

중국어 주석이나 코드는 토큰 사용량에 어떤 영향을 주나요?

중국어 문자는 영어와 다르게 토큰화됩니다. Claude의 토크나이저는 대부분의 중국어 문자를 하나에 한 토큰으로 처리해서, 중국어 소스 코드는 같은 내용의 영어보다 줄 단위로는 토큰 효율이 좋은 경우가 많지만 문자 단위로는 덜 효율적입니다(한 토큰이 영어 단어 4~6자가 아니라 한 글자를 덮기 때문입니다). Codex(GPT 계열)도 비슷한 방식입니다. 실무적 효과는 이렇습니다. 같은 내용의 주석이나 docstring이라면 어느 언어든 토큰 수는 대체로 비슷하고, 토큰당 동작은 자연어 비율보다 코드 구조가 좌우합니다.

Claude Code나 Codex CLI를 DeepSeek, Qwen, Kimi를 백엔드 모델로 쓸 수 있나요?

어댑터나 게이트웨이를 통해서만 가능합니다. Claude Code는 Anthropic API의 요청/응답 형태를 기대하고(ANTHROPIC_BASE_URL은 Anthropic 호환 엔드포인트를 가리킵니다), Codex는 OpenAI 형태를 기대합니다. DeepSeek / Qwen / Kimi는 모두 자체 API를 공개하고 있어서, Claude Code나 Codex CLI 세션이 이들을 구동하려면 변환이 필요합니다. 커뮤니티 어댑터 프로젝트가 있지만 일급은 아니고, 각 제공업체가 쓰는 도구 호출과 프롬프트 캐싱 방언이 충분히 달라서 멀티턴 에이전트 루프가 자주 깨집니다. DeepSeek / Qwen / Kimi는 별도의 셸 하네스를 통한 단발성 코드 생성과, 자체 가격대에서의 단일 파일 리뷰에는 충분히 쓸 만한 선택지입니다. 완전한 에이전트 루프 정확성과 도구 호출 신뢰성은 여전히 이 CLI들이 맞춰 조정된 프런티어 Claude와 GPT 모델에서 나옵니다.

Codex CLI와 ChatGPT의 Codex 기능은 뭐가 다른가요?

Codex CLI는 github.com/openai/codex에 있는 터미널 도구입니다. ChatGPT 안의 “Codex”는 같은 모델 계열을 ChatGPT의 웹/데스크톱/모바일 앱에서 다른 UI 방식(클라우드 작업 위임, 비동기 결과, ChatGPT 기록 통합)으로 노출한 걸 가리킵니다. CLI와 ChatGPT는 기반 모델을 공유하고, 워크플로와 컨텍스트 관리가 다릅니다. 질문이 “노트북에 어떤 도구를 설치해야 하나?”라면 그건 Codex CLI 이야기입니다.

Codex CLI를 쓰려면 ChatGPT 구독이 필요한가요?

아니요. 다만 비용에는 도움이 됩니다. Codex CLI는 토큰 단위로 과금되는 단독 OpenAI API 키로 동작합니다. ChatGPT Plus나 Pro는 Codex 사용량 일부를 묶어서 제공합니다(상한은 현재 ChatGPT 구독 페이지를 확인하세요).14 중국 개발자에게는 중국 본토 결제망을 거치는 ChatGPT 구독보다 OpenAI 계정을 통한 API 직접 과금이 대체로 더 깔끔한 경로입니다.

Claude Code의 실제 hook 개수는 몇 개인가요?

2026년 8월 기준 공식 hook 레퍼런스에 따르면 31개 생애주기 이벤트입니다.2 이 숫자는 꾸준히 늘고, 그래서 오래된 인용이 쌓입니다. 이전 글들은 언제 멈췄느냐에 따라 17개나 26개라고 적고 있습니다. 2026년 동안 추가된 것에는 PostToolUseFailure, SubagentStart, TeammateIdle, TaskCompleted, PermissionRequest, PermissionDenied, PreCompact / PostCompact, Elicitation / ElicitationResult, StopFailure, TaskCreated, CwdChanged, FileChanged, InstructionsLoaded, ConfigChange, WorktreeCreate / WorktreeRemove, Setup, 그리고 가장 최근의 DirectoryAdded(v2.1.219, 2026년 7월)가 있습니다.

Opus 4.7은 언제 나왔고 이 비교를 어떻게 바꾸나요?

2026년 4월 16일입니다. Anthropic의 Glasswing 이후 첫 GA Opus 릴리스였고, 명시적인 사이버 안전장치를 갖추고 나왔으며, Claude Code를 표준 가격으로 1M 토큰까지 끌어올리면서 SWE-bench Verified 87.6%로 선두를 가져왔습니다. 라인업은 그 뒤로 두 번 움직였습니다. Opus 4.8(2026년 5월), 그리고 같은 $5/$25의 Opus 5(2026년 7월 24일)가 나왔고, Sonnet 5(6월 30일, 네이티브 1M, $2/$10)가 Pro와 Team Standard에서 Claude Code의 기본 모델이 됐습니다. OpenAI 쪽에서는 GPT-5.5(4월 23일)가 Terminal-Bench 2.0에서 82.7%로 최고 수준을 가져갔습니다. 벤치마크 선두는 유동적입니다. 어떤 단일 결과든 특정 시점의 측정치로 다루세요. 현재 상황은 위의 컨텍스트와 모델 절을 보세요.


  1. OpenAI, “Codex CLI: Sandbox Architecture.” Seatbelt(macOS), Landlock과 seccomp(Linux). GitHub: openai/codex 

  2. Anthropic, “Claude Code Hooks reference.” 31개 hook 생애주기 이벤트(2026년 8월 기준). code.claude.com/docs/en/hooks 

  3. Linux Foundation, “AGENTS.md Open Standard.” Agentic AI Foundation. agents.md 

  4. OpenAI, Introducing GPT-5.5(2026년 4월 23일): 대부분의 Codex 작업에서 권장하는 기본값. Codex 안에서는 400K 컨텍스트, API에서는 1M. $5/$30 per MTok. Terminal-Bench 2.0 82.7%(출시 시점 공개 모델 중 최고 수준). GPT-5.4는 API에서 계속 사용 가능 — 모델 문서, 스냅샷 gpt-5.4-2026-03-05, 기본 컨텍스트 272K에 최대 1,050,000 토큰의 실험적 롱 컨텍스트 모드, 최대 출력 128K, 롱 컨텍스트 가격은 standard / batch / flex 티어 전반에서 입력 272K를 넘는 세션당 입력 2배 / 출력 1.5배. Codex CLI v0.145.0(2026년 7월 21일)은 번들된 GPT-5.4 선택지를 GPT-5.6 Terra/Luna 변형(272K 컨텍스트)으로 옮겼습니다. gpt-5.2-codex 스냅샷은 OpenAI의 지원 중단 표에 따라 2026년 7월 23일에 종료됐고, 이 표는 권장 대체로 gpt-5.6-sol을 명시합니다. 272K/128K로 여전히 제공되는 Codex 계열 변형은 GPT-5.3-Codex 모델 문서도 참고하세요. 

  5. Anthropic, Introducing Claude Sonnet 5(2026년 6월 30일): 네이티브 1M 컨텍스트, $3/$15 per MTok에 2026년 8월 31일까지 도입 가격 $2/$10. v2.1.197부터 Claude Code의 기본 모델. Claude Opus 5(2026년 7월): 1M 컨텍스트, 최대 출력 128K, $5/$25 per MTok, v2.1.219부터 opus 별칭. Claude Code model configuration도 참고하세요. 

  6. OpenAI, “Codex Cloud Tasks.” codex cloud exec 위임. developers.openai.com/codex 

  7. OpenAI, Codex CLI 릴리스 노트: 옵트인 멀티 에이전트 v2 경험이 서브 에이전트 모델, 추론 수준, 동시성을 설정할 수 있는 형태로 안정화(v0.145.0, 2026년 7월 21일). GitHub: openai/codex releases 

  8. Anthropic, “Pricing.” Claude Max 플랜. platform.claude.com/docs/en/about-claude/pricing 

  9. OpenAI, “Codex Profiles and Policies.” 설정. GitHub: openai/codex 

  10. Anthropic, “Claude Code: Best practices for agentic coding.” anthropic.com/engineering/claude-code-best-practices 

  11. Simon Willison, “Codex, Claude Code, and the state of agentic coding tools.” simonwillison.net 

  12. 벤치마크 수치(2026년 4월 스냅샷. 이후 릴리스로 갱신됨 — GPT-5.5의 Terminal-Bench 2.0 결과는 4 참고). Opus 4.7은 Anthropic 출시 페이지에서: SWE-bench Verified 87.6%, SWE-bench Pro 64.3%, Terminal-Bench 2.0 69.4%, CursorBench 70%. GPT-5.4의 공식 코딩 평가는 OpenAI: Introducing GPT-5.4에서: SWE-bench Pro 57.7%, Terminal-Bench 2.0 75.1%. GPT-5.4의 SWE-bench Verified는 공식 모델 페이지에도 출시 페이지에도 공개되지 않았습니다. 서드파티 보도(예: NxCode의 GPT-5.4 정리 글)는 SWE-bench Verified를 약 80%로 전하는데, OpenAI가 공식 수치를 낼 때까지는 서드파티로 인용합니다. GPT-5.3-Codex의 SWE-bench Pro 56.8% / Terminal-Bench 2.0 77.3%는 OpenAI: Introducing GPT-5.3-Codex에서 왔습니다. GPT-5.3-Codex에 대해 자주 인용되는 SWE-bench Verified 75.2%라는 수치는 공식 출시 페이지에 없습니다(서드파티 출처). GPT-5.2-Codex의 SWE-bench Pro 56.4% / Terminal-Bench 2.0 64.0%도 같은 출처입니다. GPT-5-Codex의 SWE-bench Verified 74.9%는 OpenAI의 최초 Codex 출시에서 널리 인용된 기준선입니다(OpenAI의 GPT-5 개발자 페이지에서도 언급됩니다). 현재 측정치가 아니라 Codex 계열의 하한선으로 다루세요. 

  13. Anthropic Pricing. Opus 5($5/$25 per MTok. Opus 4.8/4.7/4.6은 레거시 모델로 $5/$25 유지), Sonnet 5($2/$10. 2026년 8월 31일까지의 도입 가격으로 발표됐다가 2026년 9월 3일 기준 가격 페이지 안내에 따라 표준 가격이 됨), Haiku 4.5($1/$5)의 공식 토큰 단가. 프롬프트 캐싱 배수: 5분 캐시 쓰기 1.25배, 1시간 캐시 쓰기 2배, 캐시 적중은 기본 입력의 0.1배. Opus 5와 Sonnet 5의 1M 컨텍스트는 표준 가격에 포함(롱 컨텍스트 할증 없음). Batch API: 50% 할인. 

  14. 토큰 단가는 OpenAI API Pricing, 플랜 티어와 5시간 단위 요청 한도는 OpenAI Codex Pricing 참고. GPT-5.5 토큰 단가: 입력 $5 / 출력 $30 per MTok(GPT-5.4 요율의 2배. OpenAI는 토큰 효율 개선을 감안하면 실질적으로 약 20% 인상이라고 밝혔습니다). GPT-5.4 토큰 단가: 입력 $2.50 / 캐시 입력 $0.25 / 출력 $15 per MTok. 입력 272K 초과 시 2배/1.5배 롱 컨텍스트 배수. Codex 플랜은 실시간 가격 페이지 기준(2026년 8월): Plus 월 $20, Pro는 월 $100부터(5x 티어) 또는 월 $200(20x 티어), Business는 Codex 전용 좌석 종량제, Enterprise/Edu는 영업 문의. 모델별 컨텍스트 창, 요청 한도, API 티어 제공 여부는 GPT-5.4 모델 문서GPT-5.3-Codex 모델 문서도 참고하세요(gpt-5.2-codex는 2026년 7월 23일 종료). 가격은 OpenAI가 모델 변형을 교체하면서 주기적으로 개정됩니다. 이 글의 숫자는 오래된 행의 경우 2026년 8월 8일 기준 요금표를 반영하고, GPT-5.6 Sol, GPT-6 Astra, GPT-5.5 행은 2026년 9월 4일에 검증했습니다(21 참고). 

  15. AWS Bedrock runtime endpoints. 공개된 Bedrock 런타임 엔드포인트는 APAC 리전(도쿄, 서울, 싱가포르, 뭄바이, 시드니 등)을 덮지만, 2026년 4월 기준으로 중국 본토나 홍콩 런타임 엔드포인트는 목록에 없습니다. 특정 리전에 의존하기 전에 현재 커버리지를 확인하세요. 

  16. Google Vertex AI generative-AI locations. asia-east2(홍콩)를 포함한 아시아 태평양 리전이 생성형 AI 엔드포인트를 제공합니다. 모델별 제공 여부는 리전에 따라 다르고 시간이 지나며 확대됩니다. 결정하기 전에 대상 리전과 모델에 대해 locations 페이지를 확인하세요. 

  17. Claude in Microsoft Foundry. Claude는 글로벌 표준 Foundry 리전을 통해 배포됩니다. Azure China (21Vianet)은 기능 카탈로그가 별개인 독립 주권 클라우드이고, 작성 시점에 Claude는 Azure China 모델로 등재돼 있지 않습니다. 

  18. OpenAI supported countries에는 중국 본토가 없습니다. OpenAI는 미지원 국가에서의 접근이 계정 차단이나 정지로 이어질 수 있다고 경고합니다. Anthropic supported countries 역시 공식 지원 시장을 열거하는데, 작성 시점에 중국 본토는 거기 없습니다. 본토 밖 네트워크로 우회하는 독자는 그 경로에 의존하기 전에 두 제공업체의 약관과 자신의 컴플라이언스 상황을 검토하세요. 

  19. OpenAI, Codex models, 2026년 9월 3일 확인. 원문 그대로: “계정에서 사용할 수 있는 기본 Power 설정으로 시작하세요.” 그리고 “자격이 되는 Pro, Business($100), Enterprise 계정에서는 Astra 롤아웃이 Power 옵션을 Terra Light, Sol Light, Sol Medium, Astra Light, Astra Medium, Astra Extra High로 갱신합니다. 옵션은 플랜과 롤아웃 단계에 따라 다를 수 있습니다.” 같은 페이지의 8월 10일 문구 “기본 Power 설정으로 시작하세요. 이 설정은 medium 추론의 gpt-5.6-sol을 사용합니다”는 이 사이트의 Codex 가이드(그쪽 각주 201)에 기록돼 있고, 2026년 8월 11일 Wayback Machine 캡처에서도 따로 확인할 수 있습니다. OpenAI, Codex CLI rust-v0.144.6 릴리스 노트, 2026년 7월 18일. 원문 그대로: “GPT-5.6 Sol, Terra, Luna의 번들 지시를 갱신하고 이들의 컨텍스트 창을 272,000 토큰으로 정정했습니다.” Codex CLI rust-v0.149.0 릴리스 노트, 2026년 8월 20일. 여기에 PR #39102 “Raise the GPT-5.6 maximum context window”(8월 17일 머지)가 실려 있습니다. Codex 0.153.1에 실린 모델 카탈로그 codex-rs/models-manager/models.json at tag rust-v0.153.1은 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna를 context_window 272000과 max_context_window 872000으로, gpt-6-astra를 같은 두 값에 visibility hide로, gpt-5.5를 둘 다 272000으로 적고 있습니다. model_context_window 설정 키는 Codex의 설정 레퍼런스와 이 사이트의 Codex 가이드에 문서화돼 있습니다. OpenAI, API changelog, 2026년 9월 3일자 항목. 원문 그대로: “가장 어려운 종단간 작업을 위해 만든 최고 성능 모델 GPT-6 Astra를 공개했습니다.” OpenAI, GPT-6 Astra 모델 페이지, 2026년 9월 3일 확인. 모델 id gpt-6-astra, 100만 토큰당 입력 $10 / 캐시 입력 $1 / 출력 $50, 컨텍스트 창 1,050,000, 최대 출력 토큰 128,000, 지식 컷오프 2026년 4월 30일. 롱 컨텍스트 가격 문장은 본문에 원문 그대로 인용했습니다. 본문에 인용한 제공 범위 문장은 그 페이지의 배너에 있었고 2026년 9월 3일 20:06 UTC Wayback Machine 캡처에 남아 있습니다. 현재 페이지에는 더 이상 없습니다. OpenAI, Codex CLI rust-v0.153.1 릴리스 노트, 2026년 9월 3일. 원문 그대로: “기본 모델을 바꾸거나 모델 선택기에 노출하지 않으면서 API를 통해 GPT-6-Astra를 설정할 수 있는 지원을 추가했습니다.” 

  20. Anthropic, Model configuration, 2026년 9월 3일 확인. 기본 모델 목록의 네 항목 중 세 개를 원문 그대로 옮기면 이렇습니다(나머지 하나는 Microsoft Foundry를 다룹니다). “Max, Team Premium, Enterprise, Anthropic API: Opus 5가 기본값”, “AWS의 Claude Platform, Amazon Bedrock, Google Cloud의 Agent Platform: Opus 5가 기본값”, “Pro와 Team Standard: Sonnet 5가 기본값”. 같은 페이지는 “Fable 모델은 어떤 플랜이나 제공업체에서도 계정 유형별 기본값이 아닙니다”라고 밝힙니다. Anthropic, Pricing, 2026년 9월 3일 확인. 원문 그대로: “출시 시점에 2026년 8월 31일까지의 도입 가격으로 발표했던 Claude Sonnet 5의 100만 입력/출력 토큰당 $2/$10 가격은 이제 표준 가격입니다.” 같은 페이지는 Claude Fable 5.1을 입력 $10 / 출력 $50 per MTok에 캐시 읽기 $0.25 per MTok(0.025배)로 적고 있고, Claude Fable 5.1 모델 페이지는 “2026년 9월 1일 출시”라고 밝히며, 모델 개요에 1M 컨텍스트가 나옵니다. 

  21. OpenAI, API pricing, 2026년 9월 4일 확인. 100만 토큰당 standard 티어 기준으로 gpt-5.6-sol은 짧은 컨텍스트에서 입력 $4.00, 캐시 입력 $0.40, 캐시 쓰기 $5.00, 출력 $20.00이고 긴 컨텍스트에서는 $8.00 / $0.80 / $10.00 / $30.00입니다. gpt-6-astra는 짧은 컨텍스트에서 $10.00 / $1.00 / $12.50 / $50.00, 긴 컨텍스트에서 $20.00 / $2.00 / $25.00 / $75.00입니다. 이 페이지는 “GPT-5.6 Sol의 프로모션 가격은 최소 2026년 11월 21일까지 제공됩니다”라고 밝힙니다. GPT-5.6 Sol 모델 페이지는 2026년 9월 4일 확인 기준으로 “1,050,000 컨텍스트 창”과 “128,000 최대 출력 토큰”을 제시하고 “입력 토큰이 272K를 넘는 프롬프트는 요청 전체에 대해 입력 2배, 출력 1.5배로 과금됩니다”라고 밝힙니다. GPT-5.5 모델 페이지는 2026년 9월 4일 확인 기준으로 “1,050,000 컨텍스트 창”을 제시하고 100만 토큰당 입력 $5.00, 캐시 입력 $0.50, 출력 $30.00을 열거하며 “GPT-5.5의 경우 입력 토큰이 272K를 넘는 프롬프트는 standard, batch, flex에 대해 세션 전체에서 입력 2배, 출력 1.5배로 과금됩니다”라고 밝힙니다. 

관련 게시물

Claude Code vs Codex CLI 2026: 의사결정 레퍼런스

Claude Code vs Codex CLI, 2026년 6월 기준 최신 정보: Opus 4.8 vs GPT-5.5, hook vs 커널 샌드박싱, AGENTS.md 이식성, 그리고 36회 블라인드 대결 결과.

16 분 소요

AGENTS.md 패턴: 에이전트의 행동을 실제로 바꾸는 것

어떤 AGENTS.md 패턴이 에이전트의 행동을 실제로 바꿉니까? 피해야 할 안티패턴, 확실히 통하는 패턴, 그리고 8개 도구를 아우르는 호환성 매트릭스를 정리했습니다.

11 분 소요

Claude Code 스킬: 자동 활성화되는 커스텀 확장 만들기

컨텍스트에 따라 자동으로 활성화되는 커스텀 Claude Code 스킬을 만들어 보십시오. SKILL.md 구조, frontmatter, LLM 기반 매칭, git을 통한 팀 공유까지 단계별로 설명합니다.

12 분 소요