← Todos los articulos

Constituciones en tiempo de ejecución para agentes de IA: un marco de gobernanza

De la guía: Claude Code Comprehensive Guide

Las constituciones en tiempo de ejecución imponen restricciones de gobernanza mientras el agente de IA se ejecuta, no solo durante su entrenamiento. Combinan premisas normativas (los límites del comportamiento), atención constitucional (enrutamiento de reglas según el contexto), modulación de competencia (adquisición segura de habilidades con aprobación previa) y verificación de alineación con los valores (controles de salida que exigen evidencia antes de dar un trabajo por terminado). Una investigación sobre 7.308 trayectorias de agentes confirma que las habilidades autogeneradas no son confiables sin estas salvaguardas estructurales.

El sistema Learner v2 generó una habilidad nueva un martes por la tarde. La habilidad automatizaba un flujo de trabajo de publicación del blog: validar el frontmatter, revisar las citas, subir a staging. Código limpio, bien estructurado. La habilidad también anuló tres reglas de calidad de quality-loop.md porque el analizador de patrones clasificó “ejecutar siempre la puerta de evidencia” como redundante con las verificaciones que la propia habilidad ya traía incorporadas. Para el miércoles por la mañana, un artículo del blog salió publicado sin verificación de citas. La habilidad había aprendido a tomar atajos.

Arreglarlo llevó veinte minutos. La pregunta arquitectónica llevó semanas: ¿cómo dejas que un agente aprenda capacidades nuevas sin dejar que desaprenda las restricciones que lo mantienen seguro?

Resumen

La alineación en la fase de entrenamiento (RLHF, IA constitucional durante el entrenamiento, ajuste fino de seguridad) se degrada cuando los agentes operan en entornos abiertos. Seis líneas de investigación independientes convergen en la gobernanza en tiempo de ejecución: constituciones incrustadas que imponen normas durante la ejecución, no solo durante el entrenamiento. SkillsBench probó 7.308 trayectorias de agentes en 86 tareas y encontró que las habilidades autogeneradas no aportan ningún beneficio promedio: los agentes no pueden redactar de manera confiable el conocimiento procedimental que sí les sirve consumir.1 El trabajo sobre autodestilación del MIT muestra que el ajuste fino estándar provoca olvido catastrófico, donde las capacidades nuevas destruyen a las viejas.2 La arquitectura de la solución tiene cuatro componentes: premisas normativas, atención constitucional, modulación de competencia y verificación de alineación con los valores. A continuación: la teoría, la correspondencia con la práctica (tres de los cuatro componentes ya existían en mi sistema de Claude Code antes de que leyera la investigación) y una plantilla de constitución en tiempo de ejecución que puedes implementar hoy mismo.


El agente que aprendió a tomar atajos

El incidente que abre este artículo ocurrió a principios de febrero de 2026, durante la reconstrucción de Learner v210. El analizador de patrones (pattern_analyzer.py) detectó un flujo de trabajo repetido: validar el frontmatter, verificar las citas, revisar los metadatos de SEO y luego subir a staging. El generador de habilidades (skill_generator.py) compiló ese flujo en una habilidad reutilizable con validación incorporada.

Esa validación cubría el formato del frontmatter y los campos de SEO. No cubría la verificación de citas, que vive en una habilidad aparte (citation-verifier) con su propio sistema de autoridad de seis niveles. La habilidad generada marcó la revisión de citas como “resuelta” porque el analizador de patrones vio llamadas a funciones relacionadas con citas en la traza del flujo de trabajo. Confundió “se llamó a la función” con “se preservaron las restricciones de la función”.

Tres archivos definían la autoridad de las fuentes de forma distinta:

Archivo Definición de autoridad
citation-verifier/SKILL.md Sistema de seis niveles: desde fuentes primarias hasta descartables
seo-blog-playbook/SKILL.md Binario: “con autoridad” o “requiere verificación”
Habilidad generada de publicación del blog Heredó la definición binaria de SEO, no los seis niveles de citation-verifier

La arquitectura de consolidación documentada antes del incidente3 había identificado exactamente este modo de falla: cuando varios archivos definen conceptos que se solapan, las habilidades generadas heredan la definición que el analizador de patrones encuentre primero. La corrección centralizó la autoridad de las citas en una única fuente canónica. La lección fue más amplia: los agentes que adquieren capacidades nuevas necesitan garantías estructurales de que el aprendizaje no puede anular la gobernanza.


Por qué la alineación de entrenamiento falla en tiempo de ejecución

Goel, Maji y Mazumder documentaron el mecanismo: los comportamientos de seguridad se deterioran tanto con el ajuste fino benigno como con el adversario.4 Su trabajo sobre regularización adaptativa de seguridad, en arXiv:2602.17546, mostró que las actualizaciones de mayor riesgo a los pesos del modelo pueden restringirse cerca de una política de referencia segura mientras las de menor riesgo avanzan con normalidad. El enfoque funciona en tiempo de entrenamiento. No aborda lo que ocurre cuando, ya en ejecución, un agente se topa con situaciones nuevas que el entrenamiento nunca anticipó.

La brecha entre la alineación de entrenamiento y el comportamiento en ejecución crece con la autonomía. Un modelo que responde preguntas en una interfaz de chat opera dentro de límites conductuales estrechos. Un agente que escribe código, genera habilidades, ejecuta pruebas y despliega a producción opera sobre una superficie muchísimo más amplia, sobre todo cuando las conversaciones de varios turnos degradan el acceso del agente a sus propias reglas de gobernanza. La paradoja de la confianza en los agentes agrava el problema: cuanto más capaz es el agente, más difícil resulta verificar que sus capacidades siguen dentro de los límites de la gobernanza. Cada capacidad nueva crea modos de falla nuevos que la alineación de entrenamiento no puede enumerar por adelantado.

Shenfeld y sus colegas del MIT cuantificaron un modo de falla concreto: el olvido catastrófico durante el aprendizaje continuo.2 El ajuste fino supervisado estándar (SFT) sobre tareas nuevas hace que el desempeño en las tareas previas se desplome. Con 14B de parámetros, el ajuste fino por autodestilación (SDFT) superó al SFT estándar por 7 puntos en las tareas nuevas y mantuvo un 64,5 % de exactitud en las anteriores, ahí donde el SFT estándar se hunde. La contrapartida: el SDFT exige aproximadamente 4 veces más cómputo y 2,5 veces más FLOPs.

Para quien construye sistemas, la implicación es directa: cada vez que tu agente aprende algo nuevo (una habilidad generada, un flujo de trabajo en caché, una instrucción actualizada), ese aprendizaje arriesga degradar algo que el agente ya sabía. Mi anulación del quality-loop fue una instancia de olvido catastrófico a nivel de sistema. El agente “aprendió” un atajo de publicación que destruyó su capacidad de verificar citas.


Los cuatro subsistemas de la gobernanza en tiempo de ejecución

La investigación sobre gobernanza de agentes en ejecución converge en cuatro requisitos funcionales. Taghavi y sus colaboradores, trabajando sobre la evolución de constituciones interpretables, demostraron que los principios de gobernanza evolucionados con LLM superan a los diseñados por humanos en la coordinación multiagente.5 Ese trabajo, junto con el paradigma de Mahadevan que antepone la gobernanza en una ingeniería de agentes basada en principios,6 plantea el problema como cuatro subsistemas que interactúan entre sí.

Mapeé esos cuatro subsistemas sobre mi infraestructura de Claude Code existente y descubrí que tres de los cuatro ya estaban construidos, y que cada uno resolvía un problema de producción con el que me había topado meses antes de leer la investigación.

Subsistema Función Teoría Mi implementación
Ingeniería de premisas normativas Definir los límites del comportamiento aceptable Reglas constitucionales que persisten entre contextos quality-loop.md: 7 modos de falla con nombre, puerta de evidencia con 6 criterios, ciclo de calidad obligatorio
Atención constitucional Enrutar las reglas de gobernanza al contexto correcto Inyección de reglas adaptada a la tarea prompt-dispatcher.sh + 84 hooks: inyectar las reglas pertinentes según el tipo de tarea y excluir las que no vienen al caso
Modulación de competencia Gestionar con seguridad la adquisición de habilidades Expansión controlada de capacidades Learner v2: pattern_analyzer.py detecta flujos de trabajo, skill_generator.py crea habilidades con restricciones
Verificación de alineación con los valores Comprobar que las salidas coinciden con la intención de la gobernanza Verificación de cumplimiento en tiempo de ejecución Puerta de evidencia + prueba de orgullo: 6 criterios obligatorios, detección de lenguaje evasivo, rastreo de modos de falla

Subsistema 1: ingeniería de premisas normativas

El ciclo de calidad de mi sistema de agentes define siete modos de falla con nombre propio: Espiral de Atajos, Espejismo de Confianza, Meseta del “Suficientemente Bueno”, Visión de Túnel, Verificación Fantasma, Deuda Diferida e Informe Hueco.7 Cada modo de falla tiene una definición, una señal de detección y una respuesta obligatoria. No son sugerencias: son restricciones estructurales. Si el agente se detecta a sí mismo incurriendo en cualquiera de esos modos, debe reiniciar desde el paso de Evaluación.

El paralelo teórico: las premisas normativas establecen los límites conductuales dentro de los cuales opera un agente. La alineación de entrenamiento le enseña al modelo principios generales (“sé útil, inofensivo, honesto”). Las premisas normativas en ejecución codifican restricciones operativas concretas (“nunca omitas la verificación de citas”, “nunca uses lenguaje evasivo en un informe de finalización”).

La diferencia importa porque los principios de entrenamiento son probabilísticos (el modelo tiene más probabilidad de seguirlos), mientras que las premisas en ejecución pueden ser deterministas (los hooks bloquean la acción si se viola la restricción). Es la misma distinción que exploré en la puerta de evidencia: pasar de “el agente probablemente hizo lo correcto” a “el agente demostró que hizo lo correcto”.

Subsistema 2: atención constitucional

La arquitectura de contexto en siete capas9 implementa la atención constitucional mediante carga selectiva. De los 650 archivos del sistema de contexto, menos de 30 se cargan para cualquier tarea dada. Uno de los hooks del sistema, prompt-dispatcher.sh, analiza la tarea actual e inyecta las reglas de gobernanza pertinentes mientras excluye las que no aplican.

Una tarea de desarrollo web carga reglas de seguridad, reglas de diseño de API y patrones de FastAPI. No carga reglas específicas de iOS, patrones de desarrollo de videojuegos ni pautas de contenido para la app de meditación. Atención constitucional significa que el agente ve las reglas de gobernanza que aplican a esta tarea, no todas las reglas que existen.

La carga selectiva evita un modo de falla sutil: la dilución de reglas. El sistema de hooks habilita ese enrutamiento al analizar el tipo de tarea antes de inyectar el contexto. Cuando un agente recibe 200 reglas, cada regla recibe proporcionalmente menos atención que cuando recibe 20. La atención constitucional concentra el foco de la gobernanza en las reglas que importan para el contexto actual.

Subsistema 3: modulación de competencia

SkillsBench probó 7.308 trayectorias de agentes en 86 tareas de 11 dominios y encontró un resultado llamativo: las habilidades curadas mejoraron la tasa media de aprobación en 16,2 puntos porcentuales, pero las autogeneradas no aportaron beneficio alguno en promedio.1 Los agentes no pueden redactar de manera confiable el conocimiento procedimental que sí les sirve consumir. Dieciséis de las 84 tareas mostraron variaciones negativas, donde las habilidades perjudicaron activamente el desempeño.

El resultado de SkillsBench validó una salvaguarda que incorporé a Learner v2 después del incidente de la anulación del quality-loop. Ahora las habilidades generadas requieren aprobación explícita antes de activarse, y no pueden modificar ni anular archivos de gobernanza existentes. El analizador de patrones puede observar flujos de trabajo y proponer habilidades, pero el generador trata los archivos de gobernanza como inmutables.

La investigación del MIT sobre autodestilación añade una perspectiva a nivel de parámetros: en modelos más pequeños (3B de parámetros), los intentos de aprendizaje continuo directamente perjudicaron el desempeño.2 Solo a partir de 7B el modelo tiene capacidad suficiente para adquirir habilidades nuevas sin destruir las viejas. El equivalente a nivel de infraestructura: los agentes con ventanas de contexto más pequeñas o conjuntos de reglas más simples son más vulnerables a los conflictos entre capacidad y gobernanza.

Subsistema 4: verificación de alineación con los valores

La puerta de evidencia exige pruebas concretas para seis criterios antes de dar cualquier trabajo por terminado: sigue los patrones del código base (nombra el patrón), es la solución funcional más simple (explica las alternativas descartadas), cubre los casos límite (enuméralos uno por uno), las pruebas pasan (pega la salida), no hay regresiones (nombra los archivos revisados) y resuelve el problema real (formula la necesidad del usuario).7

La puerta funciona como verificación en tiempo de ejecución. El agente no puede informar que terminó usando lenguaje evasivo (“debería funcionar”, “creo que”, “parece que”). Cada afirmación exige evidencia recogida en la sesión actual. La puerta atrapa la Verificación Fantasma (afirmar que las pruebas pasan sin haberlas ejecutado) y el Informe Hueco (reportar “listo” sin especificar nada).


El problema del olvido: cuando aprender destruye lo aprendido

La historia de la consolidación de las habilidades del blog ilustra una versión del olvido catastrófico a nivel de sistema. Diez habilidades de blog, con 5.400 líneas en total, habían acumulado tres focos de duplicación.3 Las plantillas de esquema JSON-LD aparecían tanto en aio/SKILL.md como en seo-blog-playbook/SKILL.md. Las definiciones de autoridad de las citas diferían entre citation-verifier y seo-blog-playbook. Las pautas de evaluación del blog vivían a la vez en el evaluador principal y en un archivo aparte de definiciones de categorías.

Cuando el sistema Learner v2 generaba habilidades nuevas a partir de flujos de trabajo observados, tomaba las definiciones de la fuente que encontrara primero. El resultado: habilidades generadas que parecían correctas pero cargaban las definiciones de autoridad equivocadas. El sistema de citas de seis niveles degeneró en una comprobación binaria. Las plantillas de esquema divergieron entre las habilidades escritas a mano y las autogeneradas.

La corrección fue estructural: designar una única fuente canónica para cada concepto y hacer que todas las demás referencias apunten a ella. La autoridad de las citas vive en citation-verifier/SKILL.md y en ningún otro lado. Las plantillas de JSON-LD viven en aio/SKILL.md y en ningún otro lado. El patrón evita que la generación futura de habilidades herede definiciones obsoletas.

El SDFT del MIT ofrece un análogo en tiempo de entrenamiento: usar el conocimiento previo del propio modelo como señal de enseñanza al aprender capacidades nuevas.2 El SFT estándar reemplaza lo viejo por lo nuevo. La autodestilación mezcla ambos: genera datos de entrenamiento a partir de las capacidades existentes del modelo y luego ajusta sobre esa mezcla. El conocimiento previo sobrevive porque está presente en la señal de entrenamiento.

El equivalente a nivel de infraestructura: al generar una habilidad nueva, incluye las restricciones de gobernanza existentes en el prompt de generación. La habilidad generada hereda las restricciones actuales porque esas restricciones forman parte del contexto de generación, no de un sistema aparte que el generador puede pasar por alto.


Gobernanza activa frente a gobernanza pasiva

El marco RelianceScope de Jin y sus colegas distingue nueve patrones de dependencia de la IA a partir de combinaciones de participación activa y pasiva.8 Aunque su investigación estudió a estudiantes interactuando con chatbots de IA, la distinción activo/pasivo se traslada directamente a las arquitecturas de gobernanza de agentes.

La gobernanza pasiva inyecta reglas y espera que el agente las siga. Las reglas existen en CLAUDE.md o en los prompts del sistema. El agente las lee al iniciar la sesión. Nada verifica el cumplimiento. La mayoría de las configuraciones que uno encuentra en la práctica usan gobernanza pasiva: un archivo largo de instrucciones al que el agente puede o no prestar atención a medida que avanza la sesión. Como demuestra el agente invisible, los agentes que operan sin gobernanza activa no dejan rastro alguno de si siguieron sus instrucciones.

La gobernanza activa verifica el cumplimiento en tiempo de ejecución. Los hooks contrastan las salidas con las restricciones antes de que se ejecuten. Las puertas bloquean los informes de finalización que carecen de evidencia. Los monitores rastrean la deriva conductual y señalan anomalías. La gobernanza activa cuesta más (cómputo, latencia, complejidad) pero atrapa fallas que a la pasiva se le escapan.

Tipo de gobernanza Mecanismo Modo de falla que atrapa Modo de falla que se le escapa
Pasiva (reglas en CLAUDE.md) El agente lee las reglas al iniciar la sesión Violaciones flagrantes al comienzo de la sesión Dilución de reglas, deriva tardía, pérdida por compresión
Activa (hooks + puertas) Los hooks verifican el cumplimiento en cada acción Deriva, pérdida por compresión, violaciones de reglas Situaciones nuevas que los hooks existentes no contemplan
Híbrida (reglas + hooks + aprendizaje) Reglas para los límites, hooks para verificar, aprendizaje para adaptarse Deriva, compresión, situaciones nuevas (vía adaptación) Explotación adversaria del sistema de aprendizaje

El hallazgo de RelianceScope de que la búsqueda activa de ayuda se correlaciona con el uso activo de la respuesta8 sugiere un principio de arquitectura de gobernanza: los agentes que consultan activamente sus restricciones de gobernanza (en lugar de recibirlas de forma pasiva) producen salidas más apegadas a las reglas. Mi puerta de evidencia opera sobre ese principio: en vez de aplicar reglas pasivamente, el agente debe demostrar activamente el cumplimiento produciendo evidencia para cada criterio.


Una plantilla de constitución en tiempo de ejecución

Tres archivos componen una constitución mínima en tiempo de ejecución. Adapta la estructura a tu framework de agentes.

Archivo 1: constitution.md

Las premisas normativas. Lo que el agente siempre debe hacer, lo que nunca debe hacer y cómo maneja la ambigüedad.

# Agent Constitution v1

## Immutable Constraints
- Never modify files in governance/ directory
- Never skip verification steps, even if tests pass
- Never report completion without evidence for all criteria

## Behavioral Norms
- Prefer explicit over implicit (state assumptions)
- Prefer reversible over irreversible actions
- Prefer asking over guessing when requirements are ambiguous

## Failure Response
- On constraint violation: stop, log, escalate
- On ambiguity: ask, do not assume
- On capability conflict: governance wins over efficiency

Archivo 2: capabilities.json

El inventario actual de habilidades con seguimiento de procedencia.

{
  "skills": [
    {
      "name": "blog-publish",
      "version": "2.1.0",
      "source": "generated",
      "approved": true,
      "governance_refs": ["citation-verifier", "quality-loop"],
      "created": "2026-02-10",
      "constraints": [
        "Must call citation-verifier before publish",
        "Must pass evidence gate before reporting complete"
      ]
    }
  ],
  "pending_approval": [],
  "deprecated": []
}

Archivo 3: constraints-registry.json

Asigna cada restricción a su fuente canónica, con lo que se evita el problema de duplicación que provocó el incidente de las habilidades del blog.

{
  "constraints": {
    "citation-authority": {
      "canonical_source": "skills/citation-verifier/SKILL.md",
      "type": "six-tier-hierarchy",
      "overridable": false
    },
    "quality-gate": {
      "canonical_source": "rules/quality-loop.md",
      "type": "evidence-gate",
      "overridable": false
    },
    "schema-templates": {
      "canonical_source": "skills/aio/SKILL.md",
      "type": "json-ld-templates",
      "overridable": false
    }
  }
}

Los tres archivos interactúan entre sí: constitution.md define los límites conductuales, capabilities.json registra lo que el agente puede hacer con referencias cruzadas a la gobernanza y constraints-registry.json garantiza que cada restricción tenga exactamente una fuente canónica. Las habilidades generadas consultan el registro en lugar de copiar las definiciones de las restricciones. Para ver un ejemplo funcional de esta arquitectura en un ciclo de desarrollo autónomo, mira la arquitectura de agentes de Ralph. Y si das por sentado que tu entorno aislado ofrece contención suficiente por sí solo, lee antes por qué el entorno aislado de tu agente es apenas una sugerencia.


Puntos clave

  • La alineación de la fase de entrenamiento se degrada en ejecución. El ajuste fino de seguridad enseña principios generales; la gobernanza en tiempo de ejecución impone restricciones operativas concretas. Goel y sus colegas mostraron que los comportamientos de seguridad se deterioran tanto con el ajuste fino benigno como con el adversario.4
  • Las habilidades autogeneradas no son confiables. SkillsBench no halló beneficio promedio alguno en las habilidades escritas por agentes a lo largo de 7.308 trayectorias, y 16 de 84 tareas mostraron impacto negativo.1 Las habilidades generadas necesitan aprobación previa y referencias cruzadas a la gobernanza.
  • El olvido catastrófico también opera a nivel de sistema. Las capacidades nuevas pueden anular restricciones existentes incluso sin modificar los pesos del modelo. El incidente de consolidación de las habilidades del blog demostró un olvido a nivel de infraestructura, donde una habilidad generada heredó las definiciones de autoridad equivocadas.
  • Cuatro subsistemas componen la gobernanza en tiempo de ejecución. Las premisas normativas definen los límites. La atención constitucional enruta las reglas al contexto. La modulación de competencia gestiona el aprendizaje con seguridad. La verificación de alineación con los valores confirma el cumplimiento durante la ejecución.
  • La gobernanza activa supera a la pasiva. Las reglas en CLAUDE.md son necesarias pero insuficientes. Los hooks que verifican el cumplimiento en cada acción atrapan la deriva, la pérdida por compresión y la degradación tardía que las reglas pasivas dejan pasar.

Preguntas frecuentes

¿Qué es una constitución en tiempo de ejecución para agentes de IA?

Una constitución en tiempo de ejecución es un conjunto de archivos de gobernanza que imponen restricciones conductuales mientras el agente se ejecuta, no solo durante el entrenamiento del modelo. Una constitución mínima incluye tres componentes: premisas normativas (lo que el agente debe y no debe hacer), un registro de capacidades (lo que el agente puede hacer, con referencias cruzadas a la gobernanza) y un registro de restricciones (una única fuente canónica para cada restricción operativa). Las constituciones en tiempo de ejecución cierran la brecha entre la alineación de la fase de entrenamiento y el comportamiento en producción al volver determinista la gobernanza, en lugar de probabilística.

¿Por qué los agentes de IA no pueden generar sus propias habilidades de forma confiable?

SkillsBench probó 7.308 trayectorias de agentes en 86 tareas de 11 dominios y encontró que las habilidades autogeneradas no aportan beneficio promedio alguno. Las habilidades curadas mejoraron el desempeño en 16,2 puntos porcentuales, pero las escritas por agentes no mostraron mejora promedio. En 16 de 84 tareas, las habilidades autogeneradas degradaron activamente el desempeño. Los agentes pueden consumir y aplicar conocimiento procedimental con eficacia, pero no pueden redactarlo de manera confiable. Las habilidades generadas requieren revisión humana, aprobación previa y referencias cruzadas explícitas a la gobernanza antes de activarse.

¿Qué es el olvido catastrófico en los sistemas de agentes de IA?

El olvido catastrófico a nivel de sistema ocurre cuando las capacidades nuevas de un agente anulan restricciones existentes sin que se modifiquen los pesos del modelo. El ajuste fino estándar sobre tareas nuevas hace que el desempeño en las tareas previas se desplome; una investigación del MIT mostró que la exactitud del SFT estándar en tareas anteriores se degrada de forma pronunciada, mientras que el ajuste fino por autodestilación mantiene un 64,5 %. A nivel de infraestructura ocurre la misma dinámica cuando las habilidades generadas, los flujos de trabajo en caché o las instrucciones actualizadas entran en conflicto con las reglas de gobernanza existentes. La solución es estructural: designar fuentes canónicas para cada restricción y hacer que los archivos de gobernanza sean inmutables ante cualquier modificación automatizada.

¿Cómo se implementa la gobernanza activa en agentes de programación?

La gobernanza activa usa hooks, puertas y monitores para verificar el cumplimiento en tiempo de ejecución, en lugar de confiar en que el agente se autoimponga las reglas de sus instrucciones. Los hooks se ejecutan antes o después de las llamadas a herramientas para comprobar las restricciones. Las puertas bloquean los informes de finalización que carecen de evidencia para los criterios obligatorios. Los monitores rastrean métricas de comportamiento a lo largo del tiempo y señalan la deriva. Un punto de partida práctico: implementar una puerta de evidencia que exija pruebas concretas para cada criterio de calidad antes de aceptar un trabajo como terminado. Esa puerta atrapa los modos de falla más comunes (verificación fantasma, informes huecos) con una sobrecarga mínima de implementación.

¿En qué se diferencian las constituciones en tiempo de ejecución de la seguridad de agentes basada en entornos aislados?

Los entornos aislados restringen dónde puede operar un agente (límites del sistema de archivos, acceso a la red, topes de recursos). Las constituciones en tiempo de ejecución restringen cómo opera el agente dentro de esos límites (normas de comportamiento, verificaciones de competencia, controles de salida). Ambos son necesarios. Un entorno aislado impide que un agente borre bases de datos de producción, pero no puede impedir que publique código que omite la verificación de citas o anula restricciones de calidad. Las constituciones en tiempo de ejecución cubren ese hueco al incrustar reglas de gobernanza que se ejecutan junto a la toma de decisiones del propio agente y verifican el cumplimiento en cada paso, en lugar de depender únicamente de la contención perimetral.


Referencias


  1. Li, Xiangyi, et al., “SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks,” arXiv:2602.12670, febrero de 2026. arxiv.org. 86 tareas, 11 dominios, 7.308 trayectorias de agentes. Habilidades curadas: +16,2 pp en promedio; habilidades autogeneradas: 0 pp en promedio. 

  2. Shenfeld, Idan, et al., “Self-Distillation Enables Continual Learning,” arXiv:2601.19897, enero de 2026. arxiv.org. MIT Improbable AI Lab y ETH Zúrich. El SDFT supera al SFT por +7 puntos con 14B de parámetros y mantiene un 64,5 % en las tareas previas. 

  3. Documento de decisión del autor: “Blog Skills Pre-Consolidation Architecture (S3.2 Baseline),” febrero de 2026. 10 habilidades de blog, 5.400 líneas, tres focos de duplicación identificados. 

  4. Goel, Jyotin, Souvik Maji y Pratik Mazumder, “Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning,” arXiv:2602.17546, febrero de 2026. arxiv.org. La regularización adaptativa restringe las actualizaciones de pesos de mayor riesgo cerca de una política de referencia segura. 

  5. Taghavi, et al., “Evolving Interpretable Constitutions for Multi-Agent Coordination,” arXiv:2602.00755, febrero de 2026. arxiv.org. Las constituciones evolucionadas con LLM superan a los principios diseñados por humanos en la coordinación multiagente. 

  6. Mahadevan, “From Craft to Constitution: A Governance-First Paradigm for Principled Agent Engineering,” arXiv:2510.13857, octubre de 2025. arxiv.org. Introduce las “Creed Constitutions” como aplicadores modulares de cumplimiento en tiempo de ejecución. 

  7. quality-loop.md del autor y el sistema de artesanía Jiro. Siete modos de falla con nombre, puerta de evidencia con seis criterios obligatorios. Documentado en El enfoque Shokunin

  8. Jin, Hyoungwook, et al., “RelianceScope: An Analytical Framework for Examining Students’ Reliance on Generative AI Chatbots in Problem Solving,” arXiv:2602.16251, febrero de 2026. arxiv.org. Nueve patrones de dependencia según la participación activa o pasiva. Aplicado aquí a las arquitecturas de gobernanza de agentes. 

  9. Sistema context-is-architecture del autor. Jerarquía de siete capas a lo largo de 650 archivos, documentada en La ingeniería de contexto es arquitectura

  10. Sistema Learner v2 del autor. Analizador de patrones y generador de habilidades documentados en Ingeniería compuesta

Artículos relacionados

El Muro de Contención contra la Fabricación: Cuando Su Agente Publica Mentiras

Un agente autónomo publicó afirmaciones fabricadas en 8 plataformas: la seguridad del entrenamiento falló en el límite d…

16 min de lectura

Cuando tu agente encuentra una vulnerabilidad

Un investigador de Anthropic encontró una vulnerabilidad de 23 años en el kernel de Linux usando Claude Code y un script…

8 min de lectura

Su agente escribe más rápido de lo que usted puede leer

Cinco grupos de investigación, el mismo problema: los agentes de IA producen código más rápido de lo que los desarrollad…

20 min de lectura