컨텍스트 컴팩션이 학습 목표가 되어 가고 있다
긴 에이전트 세션은 언제나 같은 방식으로 끝납니다. 컨텍스트가 가득 차고, 요약이 실행되며, 실행은 이전에 있었던 일을 압축한 기억 위에서 계속됩니다. Claude Code에서 그 방아쇠는 /compact이거나, 윈도우 한계에 가까워질 때 자동으로 돌아가는 패스입니다. 운영자는 이 순간을 관리해야 할 마찰로 취급합니다. 중요한 상태를 지키고, 요약이 그것을 붙들어 주기를 바라며, 다음으로 넘어갑니다. 최근의 연구 무리는 그 본능이 곧 낡을 것이라고 말합니다. 컴팩션은 여러분이 우회 설계하는 추론 시점의 임시방편에서 모델이 직접 최적화하는 학습 시점의 목표로 이동하고 있습니다. 모델이 자신의 압축을 견뎌내는 궤적을 만들어 내도록 보상받을 때, 컨텍스트 관리는 여러분이 돌봐야 할 일이기를 멈추고 여러분이 선별해 내는 속성이 되기 시작합니다.
{.answer-block}
TL;DR
- 오늘날 컨텍스트 컴팩션은 추론 시점에 존재합니다. Anthropic 자신도 이를 컨텍스트 엔지니어링 기법으로 규정합니다. 윈도우 한계에 다가가는 대화를 요약하고 그 요약으로 다시 초기화하는 것입니다.2 그 주위를 둘러싼 런타임 도구 모음인
/compact, 자동 컴팩션, 컨텍스트 편집, 메모리 도구는 모두 자신이 컴팩션되고 있다는 사실을 모르는 모델을 감쌉니다.34 - CompactionRL은 컴팩션을 예상하도록 모델을 학습시킵니다. 강화학습으로 작업 수행과 요약 생성을 함께 최적화하여, 에이전트가 컴팩션된 궤적에 방해받는 대신 그로부터 학습하도록 합니다.1
- 수치는 실재합니다. GLM-4.5-Air에서 SWE-bench Verified의 Pass@1 66.8%에 도달하는데, 이는 7.0포인트 상승이며, Terminal-Bench 2.0에서는 24.5%를 기록합니다.1 이 벤치마크들은 논쟁적이면서도 현재적이며, 장난감이 아닙니다.89
- 이것은 논문 한 편이 아닙니다. Memory-R1은 ADD/UPDATE/DELETE 메모리 연산을 RL로 학습하고, MemAct는 컨텍스트 큐레이션을 정책이 취하는 행동으로 다루며 이를 엔드투엔드로 최적화합니다.67 서로 독립적인 세 연구 그룹이 같은 수를 향해 손을 뻗었습니다.
- 운영자를 위한 교훈은 어느 쪽이든 유효합니다. 컴팩션 이음매를 우연이 아니라 설계 대상으로 다루십시오. 무엇이 영속적 메모리에 살고 무엇이 일시적 컨텍스트에 사는지 결정하고,
PreCompact훅으로 그 경계를 지키며, 모델이 학습한 컴팩션 역량을 각주가 아니라 사양 항목으로 읽기 시작하십시오.5
모두가 이미 관리하고 있는 임시방편
컨텍스트는 유한한 자원이고, 긴 세션을 돌리는 운영자라면 누구나 그것을 아껴 쓰는 법을 배웠습니다. Anthropic의 엔지니어링 글은 그 실패 양상을 정확히 짚습니다. 토큰 수가 올라갈수록 회상 능력이 떨어지는데, 이들은 이 감퇴를 컨텍스트 로트(context rot)라고 부릅니다.2 같은 글은 그 대응책을 명료하게 정의합니다. 컴팩션이란 컨텍스트 윈도우 한계에 다가가는 대화를 가져다가 그 내용을 요약하고, 그 요약으로 새 컨텍스트 윈도우를 다시 초기화하는 관행입니다.2
그 정의를 다시 읽으며 작업이 어디에서 일어나는지 눈여겨보십시오. 그것은 모델 주위에서, 추론 시점에, 모델이 관여하지 않는 기계 장치에 의해 일어납니다. Claude Code는 그 기계 장치를 구체적으로 보여 줍니다. /compact 명령은 지금까지의 대화를 요약해 컨텍스트를 확보하며, 포커스 지시를 전달해 요약이 무엇을 남길지 조종할 수 있습니다.4 자동 컴팩션은 컨텍스트가 한계에 다가갈 때 같은 패스를 자동으로 돌립니다. autoCompactEnabled 설정을 통해 기본적으로 켜져 있으며, 그것이 작동하는 기준이 되는 실효 윈도우는 CLAUDE_CODE_AUTO_COMPACT_WINDOW로 지정하거나 DISABLE_AUTO_COMPACT로 끌 수 있습니다.4 플랫폼 쪽에서는 컨텍스트 편집이 토큰 한계에 다가갈 때 오래된 도구 호출과 결과를 자동으로 정리하고, 파일 기반 메모리 도구는 모델이 정보를 윈도우 바깥에 통째로 저장하도록 해 줍니다.3
이들은 좋은 도구입니다. Anthropic은 컨텍스트 편집만으로 장기 지평 에이전트 평가가 29% 향상되었고, 이를 메모리 도구와 짝지었을 때 100턴 실행에서 토큰 소비가 84% 줄었다고 보고합니다.3 요점은 런타임 접근법이 약하다는 것이 아닙니다. 요점은 그것이 무엇을 전제하느냐입니다. 이 기법들은 하나같이 컨텍스트를 세션의 외부 속성으로 관리하며, 압축되지 않은 궤적으로 학습되어 배포 시점에야 컴팩션을 처음 마주하는 모델에 적용됩니다. 모델은 늘 해 오던 방식대로 긴 궤적을 만들어 냅니다. 언제 요약할지, 무엇을 남길지, 어떻게 재개할지는 다른 무언가가 결정합니다. 그러면 모델은 자신이 쓰지도 않았고 예상하도록 학습된 적도 없는 압축된 컨텍스트 안에서 깨어납니다.
모델이 어떻게 학습되었는지와 어떻게 실행되는지 사이의 그 간극이 바로 새로운 연구가 메우고 있는 이음매입니다.
CompactionRL이 실제로 바꾸는 것
Zhipu의 GLM 팀이 내놓은 CompactionRL은 같은 문제 진술에서 출발해 해법을 뒤집습니다. 컴팩션을 추론에 덧붙이는 대신, 컴팩션을 모델이 하도록 학습되는 것의 일부로 만듭니다. 이 방법은 작업 수행과 요약 생성을 함께 최적화하는데, 토큰 수준 손실 정규화와 교차 궤적 일반화 어드밴티지 추정을 사용하여 에이전트가 컴팩션된 장기 지평 궤적에 탈선하는 대신 그로부터 학습할 수 있게 합니다.1
기계 장치를 걷어내면 그 변화는 말하기 쉽습니다. 런타임 접근법에서는 요약기가 정책 바깥에 앉아 있고 모델은 그것이 내놓는 무엇이든 감내합니다. CompactionRL에서는 요약이 작업을 수행하는 바로 그 정책에 의해 생성되고, 둘 다 함께 보상받습니다. 모델은 자신이 그 위에서 행동할 수 있는 요약을 쓰도록, 그리고 자신이 쓴 요약 위에서 잘 행동하도록 학습됩니다. 컴팩션은 방해이기를 멈추고 에이전트가 연습해 온 하나의 수가 됩니다.
그 결과는 현재의 벤치마크 위에 내려앉습니다. 오픈 모델인 GLM-4.5-Air 위에 구축된 CompactionRL은 SWE-bench Verified에서 Pass@1 66.8%에 도달하는데 이는 절대 7.0포인트 상승이며, Terminal-Bench 2.0에서는 24.5%를 기록합니다.1 더 작은 GLM-4.7-Flash에서는 두 벤치마크에 각각 5.5포인트와 6.8포인트를 더합니다.1 두 벤치마크 모두 실재하고 까다롭습니다. SWE-bench Verified는 실제 GitHub 이슈를 해결하기 위한, 사람이 검증한 500개 이슈 부분집합이고, Terminal-Bench 2.0은 프런티어 에이전트조차 여전히 3분의 2 미만을 기록하는, 사람이 검증한 89개 명령줄 작업입니다.89 SWE-bench Verified에는 단서를 달아 둘 만합니다. OpenAI가 2026년 초에 테스트 결함과 오염을 이유로 공개적으로 이 벤치마크에서 한 발 물러섰기 때문에, 이를 반박할 수 없는 지표가 아니라 가장 많이 인용되는 에이전트 코딩 벤치마크로 받아들이는 편이 좋습니다.8 그럼에도 이 상승치는 그 단서를 견뎌냅니다. 왜냐하면 이것은 모델 내부의 델타, 즉 같은 베이스 모델이 컴팩션을 학습해 자기 자신을 이기는 것이기 때문입니다.
이 논문에서 가장 시사적인 대목은 벤치마크가 아닙니다. CompactionRL은 다음 오픈 GLM 모델을 학습하기 위한 강화학습 파이프라인에 투입되어 있습니다.1 컴팩션은 여러분이 모델에게 하는 일에서 모델이 그것으로 만들어지는 재료로 옮겨 갔습니다.
일회성이 아니다
논문 한 편은 하나의 결과입니다. 서로 독립적인 세 그룹이 같은 수를 향해 손을 뻗는 것은 하나의 방향입니다. CompactionRL과 나란히, 2025년에 나온 다른 두 논문은 컨텍스트 관리를 감싸야 할 무언가가 아니라 학습시켜야 할 무언가로 다룹니다.
Memory-R1은 에이전트에게 ADD, UPDATE, DELETE, NOOP라는 구조화된 연산을 강화학습으로 배우는 메모리 관리자를 붙여 줍니다. 그래서 무엇을 기억하고 무엇을 버릴지에 대한 결정이 고정된 휴리스틱이 아니라 학습된 정책이 됩니다.6 이는 단 152개의 학습 예제만으로 그 결과에 도달하는데, 이는 이 능력이 값비싸다기보다 잠재되어 있음에 가깝다는 점을 시사합니다.6 MemAct는 이 글이 다루는 관점 속으로 한 걸음 더 들어갑니다. 컨텍스트 관리를 삭제와 삽입이라는 제자리 편집 연산으로 정식화하고, 정보 보존과 작업 성능을 엔드투엔드 강화학습으로 함께 최적화합니다.7 그들의 표현대로 행동으로서의 메모리, 즉 작업 컨텍스트의 큐레이션은 전처리 단계가 아니라 정책의 일부입니다.
함께 읽으면 세 논문은 하나의 이행을 그려 냅니다. 컨텍스트 편집, 외부 메모리, 예약된 요약이라는 런타임 도구 모음은 유한한 윈도우에 대한 현재의 답입니다. 학습 시점 접근법은 같은 행동들을 모델에 내재화하며, 실제로 중요한 보상, 즉 작업을 끝마치는 것을 기준으로 학습시킵니다. 같은 아이디어가 한 해 안에 메모리 연산에서, 컨텍스트 편집에서, 그리고 궤적 컴팩션에서 나타날 때, 개별 논문들은 그들이 공유하는 벡터보다 덜 중요합니다.
이것이 오늘 여러분의 구축 방식에 의미하는 바
이 중 어느 것도 내일 여러분의 하네스로 출시되지는 않으며, 정직한 운영자의 질문은 그것이 도착하는 동안 무엇을 할 것이냐입니다. 답은 기다리는 것이 아닙니다. 이 이행은 여러분이 이미 컨텍스트를 둘러싸고 하는 일의 가치를 다시 매기며, 몇 가지 수는 다가오는 버전에 대비해 여러분의 자리를 잡아 줍니다.
컴팩션 경계를 설계 대상으로 다루십시오. 지금 대부분의 운영자는 자신의 컴팩션 동작을 우연히 발견합니다. 요약이 세 번째 턴의 결정을 떨어뜨렸다는 사실을 나중에야 알아차리는 식입니다. 그것을 의도적으로 만드십시오. 어떤 리셋에서도 살아남는 영속적 메모리에 무엇이 속하는지, 즉 여러분의 규칙, 프로젝트 관례, 작업 계약을 미리 결정하고, 무엇이 요약이 압축해도 되는 일시적 컨텍스트인지 결정하십시오. Claude Code에서 영속 계층은 여러분의 CLAUDE.md와 규칙 파일이며, 이들은 컴팩션 이후 InstructionsLoaded 이벤트를 통해 다시 로드됩니다. 그리고 윈도우보다 오래 살아남아야 하는 상태를 위한 파일 기반 메모리 저장소가 있습니다.35 그 밖의 모든 것은 요약기의 몫입니다.
이음매를 희망이 아니라 훅으로 지키십시오. Claude Code는 컴팩션 전에 실행되어 그것을 조종하거나 차단할 수 있는 PreCompact 훅과, 그 후의 정리를 위한 PostCompact 훅을 제공합니다.5 어떤 부류의 상태가 절대로 요약되어 사라져서는 안 된다면, 포커스 지시가 존중되리라 믿는 대신 PreCompact 훅에서 그것을 결정론적으로 강제하십시오. 이 규율은 반드시 언제나 실행되어야 하는 무엇에든 훅을 올바른 도구로 만들어 주는 바로 그 규율입니다. 여러분은 하나의 보장을 프롬프트에서 코드로 옮기는 것입니다.
학습된 컴팩션 역량을 사양 항목으로 읽기 시작하십시오. CompactionRL의 방향이 무르익을수록, 모델들은 컨텍스트 윈도우 크기뿐 아니라 압축된 상태로 일하도록 얼마나 잘 학습되었는지에서도 갈릴 것입니다. 윈도우 크기는 지난 2년간 표제 숫자였습니다. 모든 모델 카드를 붙들어 두는 200K 대 1M 비교 말입니다. 그 숫자는 곧 더 조용한 숫자와 무대를 나누게 됩니다. 바로 모델이 스스로를 요약해야 할 때 얼마나 우아하게 성능이 저하되느냐입니다. 장기 지평 작업을 위해 모델을 평가할 때는, 최소 한 번의 컴팩션을 강제하는 진짜로 긴 작업을 그 앞에 놓고 무엇이 살아남는지 지켜보십시오. 그 동작은 선별해 낼 가치가 있는 속성이 되어 가고 있습니다.
이음매가 깔끔한 자리에 떨어지도록 긴 작업을 구조화하십시오. 컴팩션을 학습한 모델이라도 절반만 쓰다 만 하위 작업을 가로지르는 것보다 끝마친 하위 작업을 가로지를 때 여전히 더 잘 컴팩션합니다. 학습이 모든 곳에서 따라잡을 때까지는, 통과한 테스트, 커밋된 변경, 닫힌 하위 작업 같은 자연스러운 체크포인트가 컴팩션이 실행될 법한 자리에 맞아떨어지도록 작업을 다듬으면 대부분의 이득을 공짜로 얻습니다. 그것은 어차피 좋은 하네스 설계이며, 학습된 모델들이 예상하도록 배우고 있는 바로 그 구조입니다.
입장
컨텍스트 윈도우 크기는 하네스 아키텍처를 규정하는 제약이기를 멈춥니다. 지난 2년간 설계 논의는 토큰 예산에서 출발했습니다. 얼마나 들어가는지, 무엇을 내보낼지, 언제 요약할지 말입니다. 그 관점은 모델을 고정된 그릇으로, 컨텍스트를 조심스럽게 부어 넣는 자원으로 다룹니다. CompactionRL의 방향은 그 그릇을 녹여 없앱니다. 모델이 자신의 압축을 스스로 관리하도록 학습되면, 윈도우는 여러분이 맞서 설계하는 단단한 벽이기를 멈추고 모델이 걸어 내려가도록 배운 완만한 경사가 됩니다.
런타임 도구 모음은 사라지지 않습니다. 컨텍스트 편집, 메모리 도구, 수동 /compact은 진정으로 여러분의 몫인 컨텍스트 관리 부분, 즉 어떤 사실이 권위를 갖는지, 어떤 파일이 진실의 원천인지, 작업이 실제로 무엇인지에 대해서는 여전히 올바른 통제 수단으로 남습니다. 이 이행은 완전 자동화보다 더 좁고 더 흥미롭습니다. 컨텍스트 관리의 기계적인 절반, 즉 요약하고 재개하는 배관을 모델 안으로 옮기고, 무엇이 중요한지 결정하는 편집적인 절반은 여러분에게 남깁니다. 컨텍스트 엔지니어링은 모델이 다루는 것과 여러분이 여전히 소유하는 것으로 갈라지며, 그 둘 사이의 경계가 좋은 하네스 설계가 사는 새로운 자리입니다.
그 조짐은 이미 CompactionRL 논문 안에 있습니다. 컴팩션은 코딩과 추론을 위한 보상 신호 곁에서 프런티어 모델의 학습 파이프라인 안에 한 자리를 얻었습니다. 학습 루프에 도달한 능력은 보통 거기서 떠나지 않습니다. 다음 한 해를 이기는 운영자는 컴팩션을 살아남아야 할 우연으로 취급하기를 멈추고 설계해야 할 계약으로 취급하기 시작하는 사람입니다.
핵심 요점
- 컴팩션은 추론 시점에서 학습 시점으로 이행하고 있습니다. CompactionRL, Memory-R1, MemAct는 서로 독립적으로 강화학습을 사용해 컨텍스트 관리를 외부 래퍼가 아니라 학습된 동작으로 만듭니다.167
- 런타임 도구는 최종 답이 아니라 현재의 답입니다.
/compact, 자동 컴팩션, 컨텍스트 편집, 메모리 도구는 압축을 예상하도록 학습되지 않은 모델의 주위에서 컨텍스트를 관리합니다.34 - 영속적 메모리를 일시적 컨텍스트와 의도적으로 분리하십시오. 규칙, 관례, 작업 계약은 리셋에서 살아남는 계층에 두고, 그 밖의 모든 것은 압축 가능하게 두십시오.35
- 경계를
PreCompact훅으로 강제하십시오. 요약되어서는 안 되는 어떤 보장이든 포커스 지시에서 빼내어 결정론적 코드 안으로 옮기십시오.5 - 컴팩션 역량을 사양 항목으로 읽으십시오. 후보 모델을 컴팩션을 강제할 만큼 충분히 긴 작업으로 시험하고 무엇이 살아남는지 지켜보십시오. 윈도우 크기는 더 이상 중요한 유일한 숫자가 아닙니다.
자주 묻는 질문
컨텍스트 컴팩션이란 무엇인가요?
컴팩션이란 컨텍스트 윈도우 한계에 다가가는 대화를 요약하고 그 요약으로 새 윈도우를 다시 초기화하는 것으로, 장시간 실행되는 에이전트가 날것의 히스토리가 넘쳐흐를 지점을 지나서도 계속 갈 수 있게 해 줍니다.2 이는 그대로의 히스토리를 맞아떨어지는 압축된 표현과 맞바꿉니다.
Claude Code는 컨텍스트를 자동으로 컴팩션하나요?
예. 자동 컴팩션은 기본적으로 켜져 있으며 컨텍스트가 한계에 다가갈 때 실행됩니다. CLAUDE_CODE_AUTO_COMPACT_WINDOW로 실효 윈도우를 조종하거나, DISABLE_AUTO_COMPACT로 끄거나, /compact으로 패스를 수동으로 실행하면서 선택적으로 요약을 위한 포커스 지시를 전달할 수 있습니다.4
CompactionRL이란 무엇인가요?
GLM 팀이 내놓은 강화학습 방법으로, 작업 수행과 요약 생성을 함께 최적화하여 장기 지평 에이전트가 컴팩션과 함께 일하도록 학습시키므로 모델이 컴팩션된 궤적에서 배웁니다. GLM-4.5-Air를 SWE-bench Verified에서 7.0포인트 향상시키며 다음 GLM 모델의 학습 파이프라인에 투입되어 있습니다.1
모델이 자신의 컨텍스트를 스스로 관리하도록 학습시킬 수 있나요?
그것이 바로 최근의 연구가 보여 주는 바입니다. Memory-R1은 명시적 메모리 연산을 RL로 학습시키고, MemAct는 컨텍스트 편집을 정책 행동으로 다루며, CompactionRL은 궤적 컴팩션을 직접 학습시킵니다. 셋 모두 컨텍스트 관리를 런타임 부가물이 아니라 모델에 내재된 것으로 만듭니다.167
컴팩션하도록 모델을 학습시키면 컨텍스트 윈도우가 무의미해지나요?
아니요, 하지만 그 숫자가 의미하는 바를 바꿉니다. 더 큰 윈도우는 여전히 도움이 되지만, 컴팩션을 잘하도록 학습된 모델은 배포 시점에야 컴팩션을 마주하는 모델보다 어떤 윈도우 안에서든 더 멀리 갈 수 있습니다. 학습된 컴팩션 역량은 날것의 윈도우 크기와 나란히 두 번째 축이 됩니다.
지금 에이전트 컨텍스트 컴팩션에 대해 무엇을 해야 하나요?
컴팩션 이음매를 발견하는 대신 설계하십시오. 무엇이 영속적 메모리에 살고 무엇이 일시적 컨텍스트에 사는지 결정하고, PreCompact 훅으로 경계를 지키며, 컴팩션이 끝마친 하위 작업을 가로질러 떨어지도록 긴 작업을 구조화하고, 요약을 강제할 만큼 충분히 긴 작업으로 새 모델을 평가하십시오.5
출처
-
Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong. “CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents.” arXiv:2607.05378, 2026년 7월. https://arxiv.org/abs/2607.05378. GLM-4.5-Air에 대해 SWE-bench Verified에서 Pass@1 66.8%(+7.0)와 Terminal-Bench 2.0에서 24.5%를, GLM-4.7-Flash에 대해 +5.5 / +6.8을 보고하며, 이 방법이 GLM-5.2를 학습하기 위한 RL 파이프라인에 투입되어 있다고 명시합니다. ↩↩↩↩↩↩↩↩↩
-
Prithvi Rajasekaran, Ethan Dixon, Carly Ryan, Jeremy Hadfield. “Effective context engineering for AI agents.” Anthropic Engineering, 2025년 9월 29일. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents. 컴팩션과 “컨텍스트 로트(context rot)” 저하를 정의하고, 컨텍스트 엔지니어링을 추론 중 최적의 토큰 집합을 큐레이션하는 것으로 규정합니다. ↩↩↩↩
-
“Managing context on the Claude Developer Platform.” Anthropic, 2025년 9월 29일. https://claude.com/blog/context-management. 컨텍스트 편집은 토큰 한계 부근에서 “오래된 도구 호출과 결과를 자동으로 정리”하고, 메모리 도구는 컨텍스트 윈도우 바깥의 파일 기반 시스템에 정보를 저장합니다. 컨텍스트 편집만으로 29% 향상, 메모리와 결합 시 39%, 그리고 100턴 웹 검색 평가에서 84% 토큰 감소를 보고합니다. ↩↩↩↩↩↩
-
Claude Code documentation: Commands, Settings, and Environment variables. https://code.claude.com/docs/en/commands, https://code.claude.com/docs/en/settings, https://code.claude.com/docs/en/env-vars.
/compact [instructions]는 요약 후 계속하고,autoCompactEnabled(기본값 true)는 자동 컴팩션을 관장하며,CLAUDE_CODE_AUTO_COMPACT_WINDOW는 트리거에 사용되는 토큰 윈도우를 설정하고,DISABLE_AUTO_COMPACT는 그것을 끕니다. ↩↩↩↩↩ -
Claude Code Hooks reference. https://code.claude.com/docs/en/hooks.
PreCompact는 컴팩션 전에 실행되며 차단 결정을 지원하고,PostCompact는 그 후에 실행되며,InstructionsLoaded는CLAUDE.md나 규칙 파일이 로드될 때(컴팩션 이후 포함, matcher 값compact) 실행됩니다. ↩↩↩↩↩↩ -
Sikuan Yan, Xiufeng Yang, Zuchao Huang, et al. “Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning.” arXiv:2508.19828, 2025년 8월. https://arxiv.org/abs/2508.19828. 메모리 관리자가 단 152개의 학습 예제만으로 ADD, UPDATE, DELETE, NOOP 연산을 RL로 배우도록 학습시킵니다. ↩↩↩↩↩
-
Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang. “Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks.” arXiv:2510.12635, 2025년 10월. https://arxiv.org/abs/2510.12635. 컨텍스트 관리를 제자리 편집 연산으로 정식화하고 엔드투엔드 강화학습으로 최적화합니다. ↩↩↩↩
-
“Introducing SWE-bench Verified.” OpenAI, 2024년 8월 13일. https://openai.com/index/introducing-swe-bench-verified/. 실제 GitHub 이슈를 해결하기 위한, 사람이 검증한 SWE-bench의 500개 인스턴스 부분집합입니다. 참고: OpenAI는 2026년 2월에 테스트 결함과 오염을 이유로 이 벤치마크를 프런티어 지표에서 물렸으므로(https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/), 결정적 지표가 아니라 가장 많이 인용되는 에이전트 코딩 벤치마크로 읽는 편이 가장 좋습니다. ↩↩↩
-
Terminal-Bench. Stanford and the Laude Institute. https://www.tbench.ai/. Terminal-Bench 2.0은 소프트웨어 엔지니어링, ML, 보안, 데이터 과학에 걸친, 사람이 검증한 89개 명령줄 작업이며, 프런티어 에이전트는 대략 3분의 2 미만을 기록합니다. ↩↩