← Todos los articulos

La compactación de contexto se está convirtiendo en un objetivo de entrenamiento

Toda sesión larga de un agente termina de la misma manera. El contexto se llena, se dispara un resumen y la ejecución continúa sobre una memoria comprimida de lo que vino antes. En Claude Code el disparador es /compact, o la pasada automática que se ejecuta a medida que te acercas al límite de la ventana. Los operadores tratan ese momento como una fricción que hay que gestionar: proteger el estado que importa, confiar en que el resumen lo conserve y seguir adelante. Un grupo de investigaciones recientes sugiere que ese instinto está a punto de quedar obsoleto. La compactación está pasando de ser un parche en tiempo de inferencia que rodeas con ingeniería a un objetivo en tiempo de entrenamiento que el modelo optimiza directamente. Cuando se recompensa a un modelo por producir trayectorias que sobreviven a su propia compresión, la gestión del contexto deja de ser tu tarea de vigilancia y empieza a convertirse en una propiedad que seleccionas. {.answer-block}

TL;DR

  • Hoy, la compactación de contexto vive en tiempo de inferencia. La propia Anthropic la plantea como una técnica de ingeniería de contexto: resumir una conversación que se acerca al límite de la ventana y reinicializarla con el resumen.2 El conjunto de herramientas de tiempo de ejecución que la rodea —/compact, la compactación automática, la edición de contexto, la herramienta de memoria— envuelve un modelo que no sabe que está siendo compactado.34
  • CompactionRL entrena al modelo para que espere la compactación. Optimiza de forma conjunta la ejecución de la tarea y la generación del resumen mediante aprendizaje por refuerzo, de modo que el agente aprende a partir de trayectorias compactadas en lugar de verse interrumpido por ellas.1
  • Los números son reales. En GLM-4.5-Air alcanza un 66,8 % de Pass@1 en SWE-bench Verified, una ganancia de 7,0 puntos, y un 24,5 % en Terminal-Bench 2.0.1 Los benchmarks son discutidos y actuales, no juguetes.89
  • No se trata de un solo artículo. Memory-R1 entrena operaciones de memoria ADD/UPDATE/DELETE con RL; MemAct trata la curación de contexto como acciones que toma la política y las optimiza de extremo a extremo.67 Tres grupos independientes recurrieron al mismo movimiento.
  • La conclusión para el operador se sostiene en cualquier caso. Trata la costura de la compactación como una superficie de diseño, no como un accidente: decide qué vive en la memoria duradera frente al contexto transitorio, protege la frontera con un hook PreCompact y empieza a leer la competencia de compactación entrenada de un modelo como una línea de la especificación, no como una nota al pie.5

El parche que todos ya gestionan

El contexto es un recurso finito, y todo operador que ejecuta sesiones largas ha aprendido a racionarlo. La propia documentación de ingeniería de Anthropic nombra el modo de fallo con precisión: a medida que sube el conteo de tokens, la capacidad de recuerdo se degrada, un deterioro que ellos llaman context rot (pudrición del contexto).2 La misma publicación define la contramedida en términos sencillos. La compactación es la práctica de tomar una conversación que se acerca al límite de la ventana de contexto, resumir su contenido y reinicializar una nueva ventana de contexto con el resumen.2

Vuelve a leer esa definición y fíjate en dónde ocurre el trabajo. Ocurre alrededor del modelo, en tiempo de inferencia, mediante maquinaria de la que el modelo no forma parte. Claude Code hace concreta esa maquinaria. El comando /compact libera contexto resumiendo la conversación hasta el momento, y puedes pasar instrucciones de enfoque para orientar qué conserva el resumen.4 La compactación automática ejecuta la misma pasada de forma automática a medida que el contexto se acerca al límite; está activada por defecto mediante la configuración autoCompactEnabled, y estableces la ventana efectiva sobre la que se dispara con CLAUDE_CODE_AUTO_COMPACT_WINDOW o la desactivas con DISABLE_AUTO_COMPACT.4 Del lado de la plataforma, la edición de contexto borra automáticamente llamadas a herramientas y resultados obsoletos a medida que te acercas a los límites de tokens, y una herramienta de memoria basada en archivos permite que el modelo almacene información completamente fuera de la ventana.3

Son buenas herramientas. Anthropic informa que la edición de contexto por sí sola mejoró en un 29 % una evaluación de agentes de horizonte largo, y combinarla con la herramienta de memoria redujo el consumo de tokens en un 84 % a lo largo de una ejecución de cien turnos.3 La cuestión no es que el enfoque de tiempo de ejecución sea débil. La cuestión es lo que da por sentado. Cada una de estas técnicas gestiona el contexto como una propiedad externa de una sesión, aplicada a un modelo que fue entrenado con trayectorias no compactadas y que se topa con la compactación solo en el despliegue. El modelo produce una trayectoria larga como siempre lo ha hecho. Algo distinto decide cuándo resumir, qué conservar y cómo reanudar. El modelo entonces despierta dentro de un contexto comprimido que no redactó y que nunca fue entrenado para esperar.

Esa brecha, entre cómo se entrenó el modelo y cómo se ejecuta, es la costura que la nueva investigación está cerrando.

Qué cambia realmente CompactionRL

CompactionRL, del equipo de GLM en Zhipu, parte del mismo planteamiento del problema e invierte la solución. En lugar de acoplar la compactación a la inferencia, convierte la compactación en parte de lo que el modelo está entrenado para hacer. El método optimiza de forma conjunta la ejecución de la tarea y la generación del resumen, usando normalización de la pérdida a nivel de token y estimación de ventaja generalizada entre trayectorias para que el agente pueda aprender de trayectorias compactadas de horizonte largo en lugar de descarrilarse por ellas.1

Quita la maquinaria y el cambio es fácil de enunciar. En el enfoque de tiempo de ejecución, un resumidor se sitúa fuera de la política y el modelo tolera lo que sea que produzca. En CompactionRL, el resumen lo genera la misma política que hace la tarea, y ambos se recompensan juntos. El modelo se entrena para escribir resúmenes sobre los que puede actuar y para actuar bien sobre resúmenes que él mismo escribió. La compactación deja de ser una interrupción y se convierte en un movimiento que el agente ha practicado.

Los resultados aterrizan en benchmarks actuales. Construido sobre el modelo abierto GLM-4.5-Air, CompactionRL alcanza un 66,8 % de Pass@1 en SWE-bench Verified, una ganancia absoluta de 7,0 puntos, y un 24,5 % en Terminal-Bench 2.0.1 En el más pequeño GLM-4.7-Flash suma 5,5 y 6,8 puntos en los dos benchmarks.1 Ambos benchmarks son reales y difíciles: SWE-bench Verified es un subconjunto de 500 issues validado por humanos para resolver issues reales de GitHub, y Terminal-Bench 2.0 son 89 tareas de línea de comandos verificadas por humanos en las que los agentes de frontera todavía puntúan por debajo de dos tercios.89 SWE-bench Verified merece una advertencia, ya que OpenAI se distanció públicamente de él a comienzos de 2026 por fallos de prueba y contaminación, así que trátalo como el benchmark de codificación agéntica más citado y no como uno intachable.8 Las ganancias sobreviven a esa advertencia porque son deltas dentro del mismo modelo: el mismo modelo base, entrenado para compactar, se supera a sí mismo.

La línea más reveladora del artículo no es un benchmark. CompactionRL está desplegado en el pipeline de aprendizaje por refuerzo para entrenar el próximo modelo abierto de GLM.1 La compactación ha pasado de ser algo que le haces a un modelo a ser algo con lo que se construye un modelo.

No es un caso aislado

Un artículo es un resultado. Tres grupos independientes recurriendo al mismo movimiento es una dirección. Junto a CompactionRL, otros dos artículos de 2025 tratan la gestión del contexto como algo que se entrena en lugar de algo que se envuelve.

Memory-R1 dota a un agente de un gestor de memoria que aprende operaciones estructuradas —ADD, UPDATE, DELETE y NOOP— mediante aprendizaje por refuerzo, de modo que la decisión de qué recordar y qué descartar se convierte en una política aprendida en lugar de una heurística fija.6 Logra sus resultados con apenas 152 ejemplos de entrenamiento, lo que sugiere que la capacidad está más cerca de ser latente que de ser costosa.6 MemAct profundiza aún más en el marco del que trata este ensayo. Formula la gestión del contexto como operaciones de edición in situ —eliminación e inserción— y optimiza de forma conjunta la retención de información y el rendimiento en la tarea mediante aprendizaje por refuerzo de extremo a extremo.7 La memoria como acción, en sus palabras: la curación del contexto de trabajo no es un paso de preprocesamiento, es parte de la política.

Leídos en conjunto, los tres artículos describen una sola migración. El conjunto de herramientas de tiempo de ejecución —edición de contexto, memoria externa, resúmenes programados— es la respuesta actual a una ventana finita. El enfoque en tiempo de entrenamiento hace que esos mismos comportamientos sean intrínsecos al modelo, aprendidos frente a la recompensa que de verdad importa, que es terminar la tarea. Cuando la misma idea aparece en operaciones de memoria, en edición de contexto y en compactación de trayectorias dentro de un mismo año, los artículos individuales importan menos que el vector que comparten.

Qué significa esto para cómo construyes hoy

Nada de esto llega a tu harness mañana, y la pregunta honesta del operador es qué hacer mientras llega. La respuesta no es esperar. La migración revaloriza el trabajo que ya haces en torno al contexto, y unos pocos movimientos te posicionan para la versión que se avecina.

Trata la frontera de la compactación como una superficie de diseño. Ahora mismo, la mayoría de los operadores descubren su comportamiento de compactación por accidente, al notar después de los hechos que un resumen dejó fuera una decisión del turno tres. Hazlo deliberado. Decide de antemano qué pertenece a la memoria duradera que sobrevive a cualquier reinicio —tus reglas, las convenciones de tu proyecto, el contrato de la tarea— y qué es contexto transitorio que un resumen tiene permiso para comprimir. En Claude Code, la capa duradera son tu CLAUDE.md y tus archivos de reglas, que se recargan tras la compactación mediante el evento InstructionsLoaded, y un almacén de memoria basado en archivos para el estado que debe perdurar más allá de la ventana.35 Todo lo demás es terreno libre para el resumidor.

Protege la costura con un hook, no con esperanza. Claude Code expone un hook PreCompact que se dispara antes de la compactación y puede orientarla o bloquearla, y un hook PostCompact para la limpieza posterior.5 Si una clase de estado nunca debe ser resumida y descartada, un hook PreCompact es donde lo impones de forma determinista, en lugar de confiar en que una instrucción de enfoque sea respetada. La disciplina es la misma que hace de los hooks la herramienta adecuada para todo lo que siempre debe ejecutarse: sacas una garantía del prompt y la llevas al código.

Empieza a leer la competencia de compactación entrenada como una línea de la especificación. A medida que la dirección de CompactionRL madure, los modelos diferirán no solo en el tamaño de la ventana de contexto, sino en lo bien que fueron entrenados para trabajar comprimidos. El tamaño de la ventana ha sido la cifra destacada durante dos años, la comparación de 200K frente a 1M que ancla cada ficha de modelo. Esa cifra está a punto de compartir escenario con otra más discreta: con cuánta elegancia se degrada un modelo cuando tiene que resumirse a sí mismo. Cuando evalúes un modelo para trabajo de horizonte largo, ponle delante una tarea genuinamente larga, una que fuerce al menos una compactación, y observa qué sobrevive. Ese comportamiento se está convirtiendo en una propiedad que vale la pena seleccionar.

Estructura el trabajo largo para que las costuras caigan en lugares limpios. Un modelo entrenado para compactar aun así compacta mejor a través de una subtarea terminada que de una a medio escribir. Hasta que el entrenamiento se ponga al día en todas partes, obtienes la mayor parte del beneficio gratis al dar forma al trabajo para que los puntos de control naturales —una prueba que pasa, un cambio confirmado, una subtarea cerrada— coincidan con el lugar donde es probable que se dispare la compactación. Eso es buen diseño de harness de todos modos, y es exactamente la estructura que los modelos entrenados están aprendiendo a esperar.

La postura

El tamaño de la ventana de contexto deja de ser la restricción que define la arquitectura del harness. Durante dos años, la conversación de diseño ha partido de un presupuesto de tokens: cuánto cabe, qué desalojar, cuándo resumir. Ese marco trata al modelo como un recipiente fijo y al contexto como un recurso que viertes con cuidado. La dirección de CompactionRL disuelve el recipiente. Cuando el modelo se entrena para gestionar su propia compresión, la ventana deja de ser un muro duro contra el que haces ingeniería y se convierte en un gradiente suave que al modelo se le enseñó a recorrer hacia abajo.

El conjunto de herramientas de tiempo de ejecución no desaparece. La edición de contexto, las herramientas de memoria y el /compact manual siguen siendo los controles adecuados para las partes de la gestión del contexto que son genuinamente tuyas: qué hechos son autoritativos, qué archivos son la fuente de la verdad, cuál es realmente la tarea. La migración es más acotada y más interesante que la automatización total. Traslada la mitad mecánica de la gestión del contexto —la fontanería de resumir y reanudar— al modelo, y deja contigo la mitad editorial, la de decidir qué importa. La ingeniería de contexto se bifurca en lo que maneja el modelo y lo que sigue siendo tuyo, y la frontera entre ambos es el nuevo lugar donde vive el buen diseño de harness.

La señal ya está en el artículo de CompactionRL. La compactación se ganó un lugar en el pipeline de entrenamiento de un modelo de frontera, junto a las señales de recompensa para codificación y razonamiento. Las capacidades que alcanzan el bucle de entrenamiento no suelen abandonarlo. Los operadores que ganen el próximo año son los que dejan de tratar la compactación como un accidente que hay que sobrevivir y empiezan a tratarla como un contrato que hay que diseñar.

Conclusiones clave

  • La compactación está migrando del tiempo de inferencia al tiempo de entrenamiento. CompactionRL, Memory-R1 y MemAct usan de forma independiente el aprendizaje por refuerzo para hacer de la gestión del contexto un comportamiento aprendido en lugar de un envoltorio externo.167
  • Las herramientas de tiempo de ejecución son la respuesta actual, no la definitiva. /compact, la compactación automática, la edición de contexto y la herramienta de memoria gestionan el contexto alrededor de un modelo que no fue entrenado para esperar la compresión.34
  • Separa la memoria duradera del contexto transitorio, de forma deliberada. Pon las reglas, las convenciones y el contrato de la tarea en la capa que sobrevive a un reinicio; deja que todo lo demás sea comprimible.35
  • Impón la frontera con un hook PreCompact. Saca cualquier garantía de no-resumir de una instrucción de enfoque y llévala a código determinista.5
  • Lee la competencia de compactación como una línea de la especificación. Prueba un modelo candidato con una tarea lo bastante larga para forzar una compactación, y observa qué sobrevive. El tamaño de la ventana ya no es la única cifra que importa.

Preguntas frecuentes

¿Qué es la compactación de contexto?

La compactación consiste en resumir una conversación que se acerca al límite de la ventana de contexto y reinicializar una nueva ventana a partir del resumen, de modo que un agente de larga duración pueda continuar más allá del punto en el que el historial en bruto se desbordaría.2 Cambia el historial literal por una representación comprimida que sí cabe.

¿Claude Code compacta el contexto automáticamente?

Sí. La compactación automática está activada por defecto y se ejecuta a medida que el contexto se acerca al límite. Puedes orientar la ventana efectiva con CLAUDE_CODE_AUTO_COMPACT_WINDOW, desactivarla con DISABLE_AUTO_COMPACT, o disparar una pasada manualmente con /compact, pasando de forma opcional instrucciones de enfoque para el resumen.4

¿Qué es CompactionRL?

Un método de aprendizaje por refuerzo del equipo de GLM que entrena a agentes de horizonte largo para trabajar con la compactación optimizando de forma conjunta la ejecución de la tarea y la generación del resumen, de modo que el modelo aprende de trayectorias compactadas. Mejora GLM-4.5-Air en 7,0 puntos en SWE-bench Verified y está desplegado en el pipeline de entrenamiento del próximo modelo de GLM.1

¿Se puede entrenar a un modelo para que gestione su propio contexto?

Eso es exactamente lo que demuestra la investigación reciente. Memory-R1 entrena operaciones de memoria explícitas con RL, MemAct trata la edición de contexto como acciones de la política, y CompactionRL entrena directamente la compactación de trayectorias. Los tres hacen que la gestión del contexto sea intrínseca al modelo en lugar de un añadido de tiempo de ejecución.167

¿Entrenar a un modelo para compactar vuelve irrelevantes las ventanas de contexto?

No, pero cambia lo que significa la cifra. Una ventana más grande sigue ayudando, pero un modelo entrenado para compactar bien puede llegar más lejos dentro de cualquier ventana que uno que se topa con la compactación solo en el despliegue. La competencia de compactación entrenada se convierte en un segundo eje junto al tamaño bruto de la ventana.

¿Qué debería hacer ahora respecto a la compactación de contexto de los agentes?

Diseña la costura de la compactación en lugar de descubrirla. Decide qué vive en la memoria duradera frente al contexto transitorio, protege la frontera con un hook PreCompact, estructura las tareas largas para que la compactación caiga a través de subtareas terminadas, y evalúa los modelos nuevos con tareas lo bastante largas para forzar un resumen.5

Fuentes


  1. Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong. «CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents». arXiv:2607.05378, julio de 2026. https://arxiv.org/abs/2607.05378. Reporta un Pass@1 de 66,8 % en SWE-bench Verified (+7,0) y un 24,5 % en Terminal-Bench 2.0 para GLM-4.5-Air, y +5,5 / +6,8 para GLM-4.7-Flash; señala que el método está desplegado en el pipeline de RL para entrenar GLM-5.2. 

  2. Prithvi Rajasekaran, Ethan Dixon, Carly Ryan, Jeremy Hadfield. «Effective context engineering for AI agents». Anthropic Engineering, 29 de septiembre de 2025. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents. Define la compactación y el deterioro por «context rot», y plantea la ingeniería de contexto como la curación del conjunto óptimo de tokens durante la inferencia. 

  3. «Managing context on the Claude Developer Platform». Anthropic, 29 de septiembre de 2025. https://claude.com/blog/context-management. La edición de contexto «borra automáticamente llamadas a herramientas y resultados obsoletos» cerca de los límites de tokens; la herramienta de memoria almacena información en un sistema basado en archivos fuera de la ventana de contexto. Reporta una mejora del 29 % solo con la edición de contexto, del 39 % combinada con la memoria, y una reducción de tokens del 84 % en una evaluación de búsqueda web de 100 turnos. 

  4. Documentación de Claude Code: Commands, Settings y Environment variables. https://code.claude.com/docs/en/commands, https://code.claude.com/docs/en/settings, https://code.claude.com/docs/en/env-vars. /compact [instructions] resume y continúa; autoCompactEnabled (true por defecto) rige la compactación automática; CLAUDE_CODE_AUTO_COMPACT_WINDOW establece la ventana de tokens usada para el disparador; DISABLE_AUTO_COMPACT la desactiva. 

  5. Referencia de Hooks de Claude Code. https://code.claude.com/docs/en/hooks. PreCompact se dispara antes de la compactación y admite una decisión de bloqueo; PostCompact se dispara después; InstructionsLoaded se dispara cuando se cargan CLAUDE.md o los archivos de reglas, incluso tras la compactación (valor de matcher compact). 

  6. Sikuan Yan, Xiufeng Yang, Zuchao Huang, et al. «Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning». arXiv:2508.19828, agosto de 2025. https://arxiv.org/abs/2508.19828. Entrena un Memory Manager para aprender operaciones ADD, UPDATE, DELETE y NOOP mediante RL, usando solo 152 ejemplos de entrenamiento. 

  7. Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang. «Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks». arXiv:2510.12635, octubre de 2025. https://arxiv.org/abs/2510.12635. Formula la gestión del contexto como operaciones de edición in situ optimizadas de extremo a extremo con aprendizaje por refuerzo. 

  8. «Introducing SWE-bench Verified». OpenAI, 13 de agosto de 2024. https://openai.com/index/introducing-swe-bench-verified/. Un subconjunto de 500 instancias de SWE-bench validado por humanos para resolver issues reales de GitHub. Nota: OpenAI se distanció del benchmark como métrica de frontera en febrero de 2026 por fallos de prueba y contaminación (https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/), así que conviene leerlo como el benchmark de codificación agéntica más citado y no como uno definitivo. 

  9. Terminal-Bench. Stanford y el Laude Institute. https://www.tbench.ai/. Terminal-Bench 2.0 son 89 tareas de línea de comandos verificadas por humanos que abarcan ingeniería de software, ML, seguridad y ciencia de datos; los agentes de frontera puntúan por debajo de aproximadamente dos tercios. 

Artículos relacionados

La compactación de contexto es una decisión, no un umbral

Los agentes de programación compactan el contexto cuando salta un contador, no en un punto seguro: que decida el modelo …

10 min de lectura

Recompensa la herramienta antes que la respuesta

Los agentes de IA fallan cuando afirman trabajo de herramientas que nunca ocurrió. Cuatro modos de falla y la regla que …

12 min de lectura

Su agente escribe más rápido de lo que usted puede leer

Cinco grupos de investigación, el mismo problema: los agentes de IA producen código más rápido de lo que los desarrollad…

20 min de lectura